Files
olmo2_1b-exp_04-17600/trainer_state.json
ModelHub XC dc85df0f0a 初始化项目,由ModelHub XC社区提供模型
Model: Ilia2003Mah/olmo2_1b-exp_04-17600
Source: Original Platform
2026-08-31 04:28:00 +08:00

59875 lines
2.5 MiB

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 37.687366167023555,
"eval_steps": 500,
"global_step": 17600,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1689.8,
"completions/max_terminated_length": 1556.2,
"completions/mean_length": 301.266015625,
"completions/mean_terminated_length": 286.6748352050781,
"completions/min_length": 83.2,
"completions/min_terminated_length": 83.2,
"entropy": 0.16503800442442298,
"epoch": 0.021413276231263382,
"frac_reward_zero_std": 0.4625,
"grad_norm": 0.80859375,
"learning_rate": 9.9991e-06,
"loss": -0.0075,
"num_tokens": 1285065.0,
"reward": 0.8945312798023224,
"reward_std": 0.40281289219856264,
"rewards/reward_accuracy/mean": 0.796875,
"rewards/reward_accuracy/std": 0.39885675609111787,
"rewards/reward_format/mean": 0.09765625074505806,
"rewards/reward_format/std": 0.01003280533477664,
"sampling/importance_sampling_ratio/max": 2.653296637535095,
"sampling/importance_sampling_ratio/mean": 0.9684413790702819,
"sampling/importance_sampling_ratio/min": 0.050389365293085575,
"sampling/sampling_logp_difference/max": 0.7311303198337555,
"sampling/sampling_logp_difference/mean": 0.006581059983000159,
"step": 10,
"step_time": 8.399543140083551
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1737.8,
"completions/max_terminated_length": 1330.4,
"completions/mean_length": 209.42109375,
"completions/mean_terminated_length": 192.85375061035157,
"completions/min_length": 61.3,
"completions/min_terminated_length": 61.3,
"entropy": 0.14292012955993413,
"epoch": 0.042826552462526764,
"frac_reward_zero_std": 0.51875,
"grad_norm": 0.96875,
"learning_rate": 9.9981e-06,
"loss": -0.0043,
"num_tokens": 2334239.0,
"reward": 0.9225000083446503,
"reward_std": 0.3690616458654404,
"rewards/reward_accuracy/mean": 0.8234375,
"rewards/reward_accuracy/std": 0.3671683520078659,
"rewards/reward_format/mean": 0.09906250089406968,
"rewards/reward_format/std": 0.00684666836168617,
"sampling/importance_sampling_ratio/max": 2.4786211490631103,
"sampling/importance_sampling_ratio/mean": 0.9833113610744476,
"sampling/importance_sampling_ratio/min": 0.10598709061741829,
"sampling/sampling_logp_difference/max": 0.7969226837158203,
"sampling/sampling_logp_difference/mean": 0.006202959734946489,
"step": 20,
"step_time": 8.040335622103886
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 2023.5,
"completions/max_terminated_length": 1551.0,
"completions/mean_length": 192.905859375,
"completions/mean_terminated_length": 175.60045013427734,
"completions/min_length": 60.3,
"completions/min_terminated_length": 60.3,
"entropy": 0.14606270296499133,
"epoch": 0.06423982869379015,
"frac_reward_zero_std": 0.5375,
"grad_norm": 0.5625,
"learning_rate": 9.997100000000001e-06,
"loss": -0.0126,
"num_tokens": 3352638.0,
"reward": 0.8824218928813934,
"reward_std": 0.4055416703224182,
"rewards/reward_accuracy/mean": 0.78359375,
"rewards/reward_accuracy/std": 0.40373427867889405,
"rewards/reward_format/mean": 0.09882812649011612,
"rewards/reward_format/std": 0.00843207745347172,
"sampling/importance_sampling_ratio/max": 2.366842305660248,
"sampling/importance_sampling_ratio/mean": 0.9809095025062561,
"sampling/importance_sampling_ratio/min": 0.0751559054479003,
"sampling/sampling_logp_difference/max": 0.6763100028038025,
"sampling/sampling_logp_difference/mean": 0.006534823961555958,
"step": 30,
"step_time": 9.298474689899013
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01640625,
"completions/max_length": 1986.7,
"completions/max_terminated_length": 1649.1,
"completions/mean_length": 191.569921875,
"completions/mean_terminated_length": 160.91250228881836,
"completions/min_length": 55.3,
"completions/min_terminated_length": 55.3,
"entropy": 0.1544516202993691,
"epoch": 0.08565310492505353,
"frac_reward_zero_std": 0.5125,
"grad_norm": 0.7578125,
"learning_rate": 9.9961e-06,
"loss": -0.0001,
"num_tokens": 4361217.0,
"reward": 0.8939843893051147,
"reward_std": 0.3848870426416397,
"rewards/reward_accuracy/mean": 0.79609375,
"rewards/reward_accuracy/std": 0.3815509468317032,
"rewards/reward_format/mean": 0.09789062589406967,
"rewards/reward_format/std": 0.010723389545455575,
"sampling/importance_sampling_ratio/max": 2.5818888306617738,
"sampling/importance_sampling_ratio/mean": 0.9841027140617371,
"sampling/importance_sampling_ratio/min": 0.06816275753080844,
"sampling/sampling_logp_difference/max": 0.7672812283039093,
"sampling/sampling_logp_difference/mean": 0.00684510488063097,
"step": 40,
"step_time": 9.489320026012138
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012109375,
"completions/max_length": 1874.6,
"completions/max_terminated_length": 1380.1,
"completions/mean_length": 164.1984375,
"completions/mean_terminated_length": 141.18161239624024,
"completions/min_length": 52.8,
"completions/min_terminated_length": 52.8,
"entropy": 0.12915842616930603,
"epoch": 0.10706638115631692,
"frac_reward_zero_std": 0.625,
"grad_norm": 0.63671875,
"learning_rate": 9.9951e-06,
"loss": -0.015,
"num_tokens": 5291293.0,
"reward": 0.949277377128601,
"reward_std": 0.35188271999359133,
"rewards/reward_accuracy/mean": 0.850390625,
"rewards/reward_accuracy/std": 0.3496407389640808,
"rewards/reward_format/mean": 0.09888672083616257,
"rewards/reward_format/std": 0.008100975141860544,
"sampling/importance_sampling_ratio/max": 2.500232982635498,
"sampling/importance_sampling_ratio/mean": 0.9857312381267548,
"sampling/importance_sampling_ratio/min": 0.10393701773136854,
"sampling/sampling_logp_difference/max": 0.6623611927032471,
"sampling/sampling_logp_difference/mean": 0.006075166864320636,
"step": 50,
"step_time": 8.814586300775408
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.010546875,
"completions/max_length": 1941.2,
"completions/max_terminated_length": 1565.2,
"completions/mean_length": 190.837109375,
"completions/mean_terminated_length": 171.06454467773438,
"completions/min_length": 62.6,
"completions/min_terminated_length": 62.6,
"entropy": 0.1349178078584373,
"epoch": 0.1284796573875803,
"frac_reward_zero_std": 0.5875,
"grad_norm": 0.62109375,
"learning_rate": 9.994100000000001e-06,
"loss": -0.0064,
"num_tokens": 6295292.0,
"reward": 0.9257617294788361,
"reward_std": 0.37068587690591814,
"rewards/reward_accuracy/mean": 0.826953125,
"rewards/reward_accuracy/std": 0.3682569429278374,
"rewards/reward_format/mean": 0.09880859628319741,
"rewards/reward_format/std": 0.008020428405143321,
"sampling/importance_sampling_ratio/max": 2.349709224700928,
"sampling/importance_sampling_ratio/mean": 0.9771098732948303,
"sampling/importance_sampling_ratio/min": 0.07556971702724695,
"sampling/sampling_logp_difference/max": 0.6079421877861023,
"sampling/sampling_logp_difference/mean": 0.006160016497597098,
"step": 60,
"step_time": 8.95055399471894
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2026.5,
"completions/max_terminated_length": 1744.8,
"completions/mean_length": 202.791015625,
"completions/mean_terminated_length": 188.33590698242188,
"completions/min_length": 64.4,
"completions/min_terminated_length": 64.4,
"entropy": 0.13444796577095985,
"epoch": 0.14989293361884368,
"frac_reward_zero_std": 0.51875,
"grad_norm": 0.77734375,
"learning_rate": 9.993100000000001e-06,
"loss": -0.0113,
"num_tokens": 7335893.0,
"reward": 0.9230859637260437,
"reward_std": 0.369539213180542,
"rewards/reward_accuracy/mean": 0.82421875,
"rewards/reward_accuracy/std": 0.3678038567304611,
"rewards/reward_format/mean": 0.09886718988418579,
"rewards/reward_format/std": 0.007401704415678978,
"sampling/importance_sampling_ratio/max": 2.3724364757537844,
"sampling/importance_sampling_ratio/mean": 0.9747531473636627,
"sampling/importance_sampling_ratio/min": 0.10912456419318914,
"sampling/sampling_logp_difference/max": 0.9142043769359589,
"sampling/sampling_logp_difference/mean": 0.006175457779318094,
"step": 70,
"step_time": 9.45166023769416
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 5.509520633495412e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 5.509520633495412e-07,
"completions/clipped_ratio": 0.01875,
"completions/max_length": 1881.4,
"completions/max_terminated_length": 1772.7,
"completions/mean_length": 218.408203125,
"completions/mean_terminated_length": 183.69740600585936,
"completions/min_length": 62.6,
"completions/min_terminated_length": 62.6,
"entropy": 0.14230290604755283,
"epoch": 0.17130620985010706,
"frac_reward_zero_std": 0.575,
"grad_norm": 0.63671875,
"learning_rate": 9.9921e-06,
"loss": -0.003,
"num_tokens": 8410026.0,
"reward": 0.9368945598602295,
"reward_std": 0.3652557998895645,
"rewards/reward_accuracy/mean": 0.839453125,
"rewards/reward_accuracy/std": 0.3602900058031082,
"rewards/reward_format/mean": 0.09744140729308129,
"rewards/reward_format/std": 0.012345249718055128,
"sampling/importance_sampling_ratio/max": 2.555394434928894,
"sampling/importance_sampling_ratio/mean": 0.9792158007621765,
"sampling/importance_sampling_ratio/min": 0.10281872539781034,
"sampling/sampling_logp_difference/max": 0.6688772141933441,
"sampling/sampling_logp_difference/mean": 0.006499164598062634,
"step": 80,
"step_time": 9.13198133064434
},
{
"clip_ratio/high_max": 2.0738915372930934e-05,
"clip_ratio/high_mean": 2.5923644216163668e-06,
"clip_ratio/low_mean": 3.5518250115273985e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 6.144189433143765e-06,
"completions/clipped_ratio": 0.01875,
"completions/max_length": 1871.3,
"completions/max_terminated_length": 1660.3,
"completions/mean_length": 213.669921875,
"completions/mean_terminated_length": 178.95696258544922,
"completions/min_length": 60.0,
"completions/min_terminated_length": 60.0,
"entropy": 0.13997770538553594,
"epoch": 0.19271948608137046,
"frac_reward_zero_std": 0.51875,
"grad_norm": 0.63671875,
"learning_rate": 9.991100000000002e-06,
"loss": -0.0145,
"num_tokens": 9473597.0,
"reward": 0.8984375298023224,
"reward_std": 0.3928565099835396,
"rewards/reward_accuracy/mean": 0.800390625,
"rewards/reward_accuracy/std": 0.389233261346817,
"rewards/reward_format/mean": 0.09804687798023223,
"rewards/reward_format/std": 0.01062250193208456,
"sampling/importance_sampling_ratio/max": 2.4450597524642945,
"sampling/importance_sampling_ratio/mean": 0.9830299019813538,
"sampling/importance_sampling_ratio/min": 0.07355060745030642,
"sampling/sampling_logp_difference/max": 0.6408210933208466,
"sampling/sampling_logp_difference/mean": 0.006349706137552857,
"step": 90,
"step_time": 9.172977677034215
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1722.3,
"completions/max_terminated_length": 1207.8,
"completions/mean_length": 182.6265625,
"completions/mean_terminated_length": 170.19158172607422,
"completions/min_length": 57.5,
"completions/min_terminated_length": 57.5,
"entropy": 0.12242600778117776,
"epoch": 0.21413276231263384,
"frac_reward_zero_std": 0.5875,
"grad_norm": 0.70703125,
"learning_rate": 9.990100000000001e-06,
"loss": -0.0052,
"num_tokens": 10460849.0,
"reward": 0.9282226741313935,
"reward_std": 0.3655781000852585,
"rewards/reward_accuracy/mean": 0.82890625,
"rewards/reward_accuracy/std": 0.36442719399929047,
"rewards/reward_format/mean": 0.09931640699505806,
"rewards/reward_format/std": 0.006197937461547553,
"sampling/importance_sampling_ratio/max": 2.411752772331238,
"sampling/importance_sampling_ratio/mean": 0.9998455286026001,
"sampling/importance_sampling_ratio/min": 0.09601361863315105,
"sampling/sampling_logp_difference/max": 0.5277146697044373,
"sampling/sampling_logp_difference/mean": 0.005582967167720198,
"step": 100,
"step_time": 8.010274563264101
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1610.9,
"completions/max_terminated_length": 1369.9,
"completions/mean_length": 171.590625,
"completions/mean_terminated_length": 157.6996063232422,
"completions/min_length": 58.1,
"completions/min_terminated_length": 58.1,
"entropy": 0.1263415009714663,
"epoch": 0.23554603854389722,
"frac_reward_zero_std": 0.5875,
"grad_norm": 0.87109375,
"learning_rate": 9.9891e-06,
"loss": -0.0097,
"num_tokens": 11418377.0,
"reward": 0.9300781488418579,
"reward_std": 0.3668376863002777,
"rewards/reward_accuracy/mean": 0.830859375,
"rewards/reward_accuracy/std": 0.3651041090488434,
"rewards/reward_format/mean": 0.09921875149011612,
"rewards/reward_format/std": 0.005866051721386612,
"sampling/importance_sampling_ratio/max": 2.404644513130188,
"sampling/importance_sampling_ratio/mean": 0.9715279757976532,
"sampling/importance_sampling_ratio/min": 0.08773027174174786,
"sampling/sampling_logp_difference/max": 0.6986365556716919,
"sampling/sampling_logp_difference/mean": 0.005826171347871422,
"step": 110,
"step_time": 7.741869163373485
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.013671875,
"completions/max_length": 1916.2,
"completions/max_terminated_length": 1366.8,
"completions/mean_length": 176.946484375,
"completions/mean_terminated_length": 151.20050811767578,
"completions/min_length": 60.0,
"completions/min_terminated_length": 60.0,
"entropy": 0.13139069378376006,
"epoch": 0.2569593147751606,
"frac_reward_zero_std": 0.60625,
"grad_norm": 0.8203125,
"learning_rate": 9.9881e-06,
"loss": -0.0014,
"num_tokens": 12392960.0,
"reward": 0.8821875214576721,
"reward_std": 0.40001245141029357,
"rewards/reward_accuracy/mean": 0.78359375,
"rewards/reward_accuracy/std": 0.3974467471241951,
"rewards/reward_format/mean": 0.09859374985098839,
"rewards/reward_format/std": 0.009218690707348287,
"sampling/importance_sampling_ratio/max": 2.3937487244606017,
"sampling/importance_sampling_ratio/mean": 0.979498291015625,
"sampling/importance_sampling_ratio/min": 0.05801301626488566,
"sampling/sampling_logp_difference/max": 0.7055964231491089,
"sampling/sampling_logp_difference/mean": 0.005767674976959824,
"step": 120,
"step_time": 9.02613644534722
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012109375,
"completions/max_length": 2045.8,
"completions/max_terminated_length": 1569.4,
"completions/mean_length": 177.850390625,
"completions/mean_terminated_length": 155.0331573486328,
"completions/min_length": 51.8,
"completions/min_terminated_length": 51.8,
"entropy": 0.13719871155917646,
"epoch": 0.278372591006424,
"frac_reward_zero_std": 0.58125,
"grad_norm": 0.77734375,
"learning_rate": 9.987100000000001e-06,
"loss": -0.0151,
"num_tokens": 13362273.0,
"reward": 0.9264453470706939,
"reward_std": 0.36956382989883424,
"rewards/reward_accuracy/mean": 0.827734375,
"rewards/reward_accuracy/std": 0.36676925122737886,
"rewards/reward_format/mean": 0.09871093779802323,
"rewards/reward_format/std": 0.009152110037393867,
"sampling/importance_sampling_ratio/max": 2.455416131019592,
"sampling/importance_sampling_ratio/mean": 0.9859054565429688,
"sampling/importance_sampling_ratio/min": 0.04564662054181099,
"sampling/sampling_logp_difference/max": 0.7309700608253479,
"sampling/sampling_logp_difference/mean": 0.006187488324940205,
"step": 130,
"step_time": 9.445366340549663
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0265625,
"completions/max_length": 1900.1,
"completions/max_terminated_length": 1227.7,
"completions/mean_length": 211.42890625,
"completions/mean_terminated_length": 162.0924850463867,
"completions/min_length": 59.5,
"completions/min_terminated_length": 59.5,
"entropy": 0.154626948479563,
"epoch": 0.29978586723768735,
"frac_reward_zero_std": 0.46875,
"grad_norm": 0.90625,
"learning_rate": 9.9861e-06,
"loss": -0.0125,
"num_tokens": 14423771.0,
"reward": 0.8552344024181366,
"reward_std": 0.42746672332286834,
"rewards/reward_accuracy/mean": 0.7578125,
"rewards/reward_accuracy/std": 0.42302260398864744,
"rewards/reward_format/mean": 0.09742187708616257,
"rewards/reward_format/std": 0.012623216118663549,
"sampling/importance_sampling_ratio/max": 2.3324547290802,
"sampling/importance_sampling_ratio/mean": 0.9725462436676026,
"sampling/importance_sampling_ratio/min": 0.07414196860045194,
"sampling/sampling_logp_difference/max": 0.7267895817756653,
"sampling/sampling_logp_difference/mean": 0.0067431832198053595,
"step": 140,
"step_time": 9.081448095850646
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.022265625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1566.1,
"completions/mean_length": 209.867578125,
"completions/mean_terminated_length": 168.2657440185547,
"completions/min_length": 56.4,
"completions/min_terminated_length": 56.4,
"entropy": 0.14393569538369774,
"epoch": 0.32119914346895073,
"frac_reward_zero_std": 0.50625,
"grad_norm": 1.0546875,
"learning_rate": 9.9851e-06,
"loss": -0.0081,
"num_tokens": 15478600.0,
"reward": 0.8943359434604645,
"reward_std": 0.40177545249462127,
"rewards/reward_accuracy/mean": 0.796484375,
"rewards/reward_accuracy/std": 0.3973024427890778,
"rewards/reward_format/mean": 0.09785156324505806,
"rewards/reward_format/std": 0.012780764722265303,
"sampling/importance_sampling_ratio/max": 2.6029918670654295,
"sampling/importance_sampling_ratio/mean": 0.9915633022785186,
"sampling/importance_sampling_ratio/min": 0.02743674712255597,
"sampling/sampling_logp_difference/max": 0.855018037557602,
"sampling/sampling_logp_difference/mean": 0.006300653191283345,
"step": 150,
"step_time": 9.74286238285713
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1869.0,
"completions/max_terminated_length": 1381.2,
"completions/mean_length": 181.31796875,
"completions/mean_terminated_length": 157.84009323120117,
"completions/min_length": 54.5,
"completions/min_terminated_length": 54.5,
"entropy": 0.13950672606006265,
"epoch": 0.3426124197002141,
"frac_reward_zero_std": 0.54375,
"grad_norm": 0.9296875,
"learning_rate": 9.984100000000002e-06,
"loss": -0.0023,
"num_tokens": 16459046.0,
"reward": 0.8854101896286011,
"reward_std": 0.39791751503944395,
"rewards/reward_accuracy/mean": 0.78671875,
"rewards/reward_accuracy/std": 0.39541620314121245,
"rewards/reward_format/mean": 0.0986914061009884,
"rewards/reward_format/std": 0.009678102401085197,
"sampling/importance_sampling_ratio/max": 2.4542437553405763,
"sampling/importance_sampling_ratio/mean": 0.9903126358985901,
"sampling/importance_sampling_ratio/min": 0.11864679716527463,
"sampling/sampling_logp_difference/max": 0.7811646819114685,
"sampling/sampling_logp_difference/mean": 0.0061691795010119675,
"step": 160,
"step_time": 8.705859960569068
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 7.18225692253327e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 7.18225692253327e-07,
"completions/clipped_ratio": 0.030078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1762.3,
"completions/mean_length": 241.995703125,
"completions/mean_terminated_length": 186.23339233398437,
"completions/min_length": 62.9,
"completions/min_terminated_length": 62.9,
"entropy": 0.15126340091228485,
"epoch": 0.3640256959314775,
"frac_reward_zero_std": 0.55625,
"grad_norm": 0.408203125,
"learning_rate": 9.983100000000001e-06,
"loss": -0.0059,
"num_tokens": 17601643.0,
"reward": 0.9007617413997651,
"reward_std": 0.3949627667665482,
"rewards/reward_accuracy/mean": 0.80390625,
"rewards/reward_accuracy/std": 0.3878025025129318,
"rewards/reward_format/mean": 0.09685547128319741,
"rewards/reward_format/std": 0.015166912414133548,
"sampling/importance_sampling_ratio/max": 2.5566648721694945,
"sampling/importance_sampling_ratio/mean": 0.9823035657405853,
"sampling/importance_sampling_ratio/min": 0.01948281191289425,
"sampling/sampling_logp_difference/max": 0.9330565929412842,
"sampling/sampling_logp_difference/mean": 0.006233416916802526,
"step": 170,
"step_time": 10.111618541320786
},
{
"clip_ratio/high_max": 9.72459965851158e-06,
"clip_ratio/high_mean": 1.2155749573139474e-06,
"clip_ratio/low_mean": 3.0589271773351354e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.5214676750474609e-06,
"completions/clipped_ratio": 0.019140625,
"completions/max_length": 1986.7,
"completions/max_terminated_length": 1719.3,
"completions/mean_length": 237.691796875,
"completions/mean_terminated_length": 202.68127899169923,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.1569390209391713,
"epoch": 0.3854389721627409,
"frac_reward_zero_std": 0.51875,
"grad_norm": 0.64453125,
"learning_rate": 9.9821e-06,
"loss": -0.0126,
"num_tokens": 18732406.0,
"reward": 0.8579492390155792,
"reward_std": 0.4229008972644806,
"rewards/reward_accuracy/mean": 0.759765625,
"rewards/reward_accuracy/std": 0.4198786973953247,
"rewards/reward_format/mean": 0.09818359464406967,
"rewards/reward_format/std": 0.010203328751958906,
"sampling/importance_sampling_ratio/max": 2.5067942261695864,
"sampling/importance_sampling_ratio/mean": 0.9829773962497711,
"sampling/importance_sampling_ratio/min": 0.07496326249092818,
"sampling/sampling_logp_difference/max": 0.6532892286777496,
"sampling/sampling_logp_difference/mean": 0.006633048364892602,
"step": 180,
"step_time": 9.768640909157693
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01953125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1703.7,
"completions/mean_length": 266.333203125,
"completions/mean_terminated_length": 231.14380340576173,
"completions/min_length": 72.3,
"completions/min_terminated_length": 72.3,
"entropy": 0.1748073108494282,
"epoch": 0.4068522483940043,
"frac_reward_zero_std": 0.4875,
"grad_norm": 0.55859375,
"learning_rate": 9.981100000000002e-06,
"loss": -0.0168,
"num_tokens": 19938123.0,
"reward": 0.9196484684944153,
"reward_std": 0.3713774815201759,
"rewards/reward_accuracy/mean": 0.821875,
"rewards/reward_accuracy/std": 0.36746798604726794,
"rewards/reward_format/mean": 0.09777343943715096,
"rewards/reward_format/std": 0.01182347172871232,
"sampling/importance_sampling_ratio/max": 2.5152854442596437,
"sampling/importance_sampling_ratio/mean": 0.9553942918777466,
"sampling/importance_sampling_ratio/min": 0.02115938547067344,
"sampling/sampling_logp_difference/max": 1.0791487336158752,
"sampling/sampling_logp_difference/mean": 0.00703223878517747,
"step": 190,
"step_time": 9.950964004453272
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02109375,
"completions/max_length": 1980.0,
"completions/max_terminated_length": 1745.3,
"completions/mean_length": 284.98125,
"completions/mean_terminated_length": 247.54713439941406,
"completions/min_length": 72.0,
"completions/min_terminated_length": 72.0,
"entropy": 0.17252881079912186,
"epoch": 0.4282655246252677,
"frac_reward_zero_std": 0.5125,
"grad_norm": 0.59765625,
"learning_rate": 9.9801e-06,
"loss": -0.0212,
"num_tokens": 21187435.0,
"reward": 0.9011523604393006,
"reward_std": 0.3890772670507431,
"rewards/reward_accuracy/mean": 0.803515625,
"rewards/reward_accuracy/std": 0.38509434163570405,
"rewards/reward_format/mean": 0.09763671979308128,
"rewards/reward_format/std": 0.011838894966058434,
"sampling/importance_sampling_ratio/max": 2.5474149346351624,
"sampling/importance_sampling_ratio/mean": 0.9766521573066711,
"sampling/importance_sampling_ratio/min": 0.015180078893899917,
"sampling/sampling_logp_difference/max": 0.6660357922315597,
"sampling/sampling_logp_difference/mean": 0.006749289808794856,
"step": 200,
"step_time": 9.603486723592505
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012890625,
"completions/max_length": 2006.2,
"completions/max_terminated_length": 1702.2,
"completions/mean_length": 236.538671875,
"completions/mean_terminated_length": 212.97097625732422,
"completions/min_length": 74.3,
"completions/min_terminated_length": 74.3,
"entropy": 0.15436679925769567,
"epoch": 0.44967880085653106,
"frac_reward_zero_std": 0.5875,
"grad_norm": 0.65234375,
"learning_rate": 9.9791e-06,
"loss": -0.0107,
"num_tokens": 22307918.0,
"reward": 0.968046897649765,
"reward_std": 0.3281402811408043,
"rewards/reward_accuracy/mean": 0.86953125,
"rewards/reward_accuracy/std": 0.3247923329472542,
"rewards/reward_format/mean": 0.09851562529802323,
"rewards/reward_format/std": 0.00954692114610225,
"sampling/importance_sampling_ratio/max": 2.3249094605445864,
"sampling/importance_sampling_ratio/mean": 0.9743193805217742,
"sampling/importance_sampling_ratio/min": 0.048329275101423264,
"sampling/sampling_logp_difference/max": 1.1993927955627441,
"sampling/sampling_logp_difference/mean": 0.006329587940126657,
"step": 210,
"step_time": 9.420172037975863
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01328125,
"completions/max_length": 1949.8,
"completions/max_terminated_length": 1708.5,
"completions/mean_length": 252.3484375,
"completions/mean_terminated_length": 228.26724700927736,
"completions/min_length": 75.5,
"completions/min_terminated_length": 75.5,
"entropy": 0.15897367959842085,
"epoch": 0.47109207708779444,
"frac_reward_zero_std": 0.54375,
"grad_norm": 0.67578125,
"learning_rate": 9.9781e-06,
"loss": -0.019,
"num_tokens": 23473578.0,
"reward": 0.9489453256130218,
"reward_std": 0.34329227432608606,
"rewards/reward_accuracy/mean": 0.850390625,
"rewards/reward_accuracy/std": 0.34029669389128686,
"rewards/reward_format/mean": 0.0985546886920929,
"rewards/reward_format/std": 0.009705392783507705,
"sampling/importance_sampling_ratio/max": 2.3432349443435667,
"sampling/importance_sampling_ratio/mean": 0.968984580039978,
"sampling/importance_sampling_ratio/min": 0.03236568383872509,
"sampling/sampling_logp_difference/max": 0.6265906810760498,
"sampling/sampling_logp_difference/mean": 0.006590941734611988,
"step": 220,
"step_time": 9.200759962759912
},
{
"clip_ratio/high_max": 1.0617965745041148e-05,
"clip_ratio/high_mean": 1.3272457181301434e-06,
"clip_ratio/low_mean": 2.6002662707469425e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.5872723452048375e-06,
"completions/clipped_ratio": 0.02578125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1811.4,
"completions/mean_length": 295.088671875,
"completions/mean_terminated_length": 248.85442810058595,
"completions/min_length": 73.2,
"completions/min_terminated_length": 73.2,
"entropy": 0.1703632994554937,
"epoch": 0.4925053533190578,
"frac_reward_zero_std": 0.45,
"grad_norm": 0.76171875,
"learning_rate": 9.977100000000001e-06,
"loss": -0.0121,
"num_tokens": 24749645.0,
"reward": 0.8889843940734863,
"reward_std": 0.4046052634716034,
"rewards/reward_accuracy/mean": 0.79140625,
"rewards/reward_accuracy/std": 0.40005778074264525,
"rewards/reward_format/mean": 0.09757812544703484,
"rewards/reward_format/std": 0.013030602596700191,
"sampling/importance_sampling_ratio/max": 2.6804869890213014,
"sampling/importance_sampling_ratio/mean": 0.9650364279747009,
"sampling/importance_sampling_ratio/min": 0.017811396159231663,
"sampling/sampling_logp_difference/max": 0.7515988826751709,
"sampling/sampling_logp_difference/mean": 0.006866492377594113,
"step": 230,
"step_time": 10.003458055853844
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.019140625,
"completions/max_length": 1980.0,
"completions/max_terminated_length": 1747.5,
"completions/mean_length": 252.9515625,
"completions/mean_terminated_length": 217.93970947265626,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.16131126508116722,
"epoch": 0.5139186295503212,
"frac_reward_zero_std": 0.525,
"grad_norm": 0.5546875,
"learning_rate": 9.976100000000001e-06,
"loss": -0.0172,
"num_tokens": 25928129.0,
"reward": 0.9422070503234863,
"reward_std": 0.35469307750463486,
"rewards/reward_accuracy/mean": 0.844140625,
"rewards/reward_accuracy/std": 0.3506337657570839,
"rewards/reward_format/mean": 0.09806640669703484,
"rewards/reward_format/std": 0.011627811496146024,
"sampling/importance_sampling_ratio/max": 2.3747957944869995,
"sampling/importance_sampling_ratio/mean": 0.9665410101413727,
"sampling/importance_sampling_ratio/min": 0.027348649501800538,
"sampling/sampling_logp_difference/max": 0.833703088760376,
"sampling/sampling_logp_difference/mean": 0.006626122677698731,
"step": 240,
"step_time": 9.535299448482693
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.017578125,
"completions/max_length": 1887.6,
"completions/max_terminated_length": 1473.5,
"completions/mean_length": 242.821484375,
"completions/mean_terminated_length": 211.0764892578125,
"completions/min_length": 69.1,
"completions/min_terminated_length": 69.1,
"entropy": 0.15672999983653427,
"epoch": 0.5353319057815846,
"frac_reward_zero_std": 0.5875,
"grad_norm": 0.66015625,
"learning_rate": 9.9751e-06,
"loss": -0.0142,
"num_tokens": 27065800.0,
"reward": 0.9000390827655792,
"reward_std": 0.38530259132385253,
"rewards/reward_accuracy/mean": 0.801953125,
"rewards/reward_accuracy/std": 0.3817975491285324,
"rewards/reward_format/mean": 0.09808593988418579,
"rewards/reward_format/std": 0.010538362385705113,
"sampling/importance_sampling_ratio/max": 2.530345582962036,
"sampling/importance_sampling_ratio/mean": 0.982217276096344,
"sampling/importance_sampling_ratio/min": 0.05016824994236231,
"sampling/sampling_logp_difference/max": 0.6506958127021789,
"sampling/sampling_logp_difference/mean": 0.006455441843718291,
"step": 250,
"step_time": 9.08839970054105
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0359375,
"completions/max_length": 1878.9,
"completions/max_terminated_length": 1667.0,
"completions/mean_length": 277.873828125,
"completions/mean_terminated_length": 212.26934814453125,
"completions/min_length": 67.6,
"completions/min_terminated_length": 67.6,
"entropy": 0.17280294466763735,
"epoch": 0.556745182012848,
"frac_reward_zero_std": 0.5,
"grad_norm": 0.5625,
"learning_rate": 9.974100000000002e-06,
"loss": -0.0132,
"num_tokens": 28297797.0,
"reward": 0.9247265815734863,
"reward_std": 0.3772251486778259,
"rewards/reward_accuracy/mean": 0.82734375,
"rewards/reward_accuracy/std": 0.3718470513820648,
"rewards/reward_format/mean": 0.09738281294703484,
"rewards/reward_format/std": 0.01317462269216776,
"sampling/importance_sampling_ratio/max": 2.4532822370529175,
"sampling/importance_sampling_ratio/mean": 0.9770439505577088,
"sampling/importance_sampling_ratio/min": 0.0343831330537796,
"sampling/sampling_logp_difference/max": 0.9563548326492309,
"sampling/sampling_logp_difference/mean": 0.006806593574583531,
"step": 260,
"step_time": 9.531171284848824
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.025,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1717.2,
"completions/mean_length": 241.68828125,
"completions/mean_terminated_length": 195.51385192871095,
"completions/min_length": 62.3,
"completions/min_terminated_length": 62.3,
"entropy": 0.1635963972657919,
"epoch": 0.5781584582441114,
"frac_reward_zero_std": 0.49375,
"grad_norm": 0.466796875,
"learning_rate": 9.973100000000001e-06,
"loss": -0.0153,
"num_tokens": 29429735.0,
"reward": 0.8947461068630218,
"reward_std": 0.39585974514484407,
"rewards/reward_accuracy/mean": 0.796875,
"rewards/reward_accuracy/std": 0.39193362891674044,
"rewards/reward_format/mean": 0.09787109419703484,
"rewards/reward_format/std": 0.012965353857725858,
"sampling/importance_sampling_ratio/max": 2.389664626121521,
"sampling/importance_sampling_ratio/mean": 0.9690044820308685,
"sampling/importance_sampling_ratio/min": 0.008558434061706066,
"sampling/sampling_logp_difference/max": 0.6382080137729644,
"sampling/sampling_logp_difference/mean": 0.006901593692600727,
"step": 270,
"step_time": 9.79771754979156
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02578125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1753.4,
"completions/mean_length": 230.67734375,
"completions/mean_terminated_length": 183.1858688354492,
"completions/min_length": 57.3,
"completions/min_terminated_length": 57.3,
"entropy": 0.15891095688566564,
"epoch": 0.5995717344753747,
"frac_reward_zero_std": 0.49375,
"grad_norm": 0.6796875,
"learning_rate": 9.9721e-06,
"loss": -0.0081,
"num_tokens": 30534765.0,
"reward": 0.8939648628234863,
"reward_std": 0.378990963101387,
"rewards/reward_accuracy/mean": 0.796484375,
"rewards/reward_accuracy/std": 0.3743096858263016,
"rewards/reward_format/mean": 0.09748047068715096,
"rewards/reward_format/std": 0.01297167136799544,
"sampling/importance_sampling_ratio/max": 2.56362464427948,
"sampling/importance_sampling_ratio/mean": 0.9868412375450134,
"sampling/importance_sampling_ratio/min": 0.03003610800951719,
"sampling/sampling_logp_difference/max": 0.7611776053905487,
"sampling/sampling_logp_difference/mean": 0.006613596482202411,
"step": 280,
"step_time": 9.803738680807873
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.03203125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1688.4,
"completions/mean_length": 241.26953125,
"completions/mean_terminated_length": 181.87459869384764,
"completions/min_length": 60.4,
"completions/min_terminated_length": 60.4,
"entropy": 0.1700191461481154,
"epoch": 0.6209850107066381,
"frac_reward_zero_std": 0.59375,
"grad_norm": 0.96484375,
"learning_rate": 9.971100000000002e-06,
"loss": -0.021,
"num_tokens": 31674719.0,
"reward": 0.9080469012260437,
"reward_std": 0.3793750494718552,
"rewards/reward_accuracy/mean": 0.8109375,
"rewards/reward_accuracy/std": 0.3737005114555359,
"rewards/reward_format/mean": 0.0971093751490116,
"rewards/reward_format/std": 0.014068746450357139,
"sampling/importance_sampling_ratio/max": 2.3827908635139465,
"sampling/importance_sampling_ratio/mean": 0.9718930125236511,
"sampling/importance_sampling_ratio/min": 0.025338194519281387,
"sampling/sampling_logp_difference/max": 0.6687077581882477,
"sampling/sampling_logp_difference/mean": 0.006832589814439416,
"step": 290,
"step_time": 10.044561673887074
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.03046875,
"completions/max_length": 1865.6,
"completions/max_terminated_length": 1546.9,
"completions/mean_length": 222.88515625,
"completions/mean_terminated_length": 166.32235946655274,
"completions/min_length": 58.4,
"completions/min_terminated_length": 58.4,
"entropy": 0.16172117525711655,
"epoch": 0.6423982869379015,
"frac_reward_zero_std": 0.53125,
"grad_norm": 0.80859375,
"learning_rate": 9.9701e-06,
"loss": -0.0137,
"num_tokens": 32757929.0,
"reward": 0.8890625298023224,
"reward_std": 0.3926051750779152,
"rewards/reward_accuracy/mean": 0.791796875,
"rewards/reward_accuracy/std": 0.3882806658744812,
"rewards/reward_format/mean": 0.09726562649011612,
"rewards/reward_format/std": 0.012594443932175636,
"sampling/importance_sampling_ratio/max": 2.391991472244263,
"sampling/importance_sampling_ratio/mean": 0.9688705980777741,
"sampling/importance_sampling_ratio/min": 0.09966090116649866,
"sampling/sampling_logp_difference/max": 0.7618421196937561,
"sampling/sampling_logp_difference/mean": 0.0067974757868796585,
"step": 300,
"step_time": 9.044813453406096
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.3995944755151867e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.3995944755151867e-06,
"completions/clipped_ratio": 0.0359375,
"completions/max_length": 2047.2,
"completions/max_terminated_length": 1873.8,
"completions/mean_length": 255.838671875,
"completions/mean_terminated_length": 189.53061218261718,
"completions/min_length": 53.9,
"completions/min_terminated_length": 53.9,
"entropy": 0.1894565925002098,
"epoch": 0.6638115631691649,
"frac_reward_zero_std": 0.53125,
"grad_norm": 0.6953125,
"learning_rate": 9.9691e-06,
"loss": -0.0134,
"num_tokens": 33930668.0,
"reward": 0.9082617580890655,
"reward_std": 0.3862216055393219,
"rewards/reward_accuracy/mean": 0.81171875,
"rewards/reward_accuracy/std": 0.3800092667341232,
"rewards/reward_format/mean": 0.09654297158122063,
"rewards/reward_format/std": 0.014839219022542238,
"sampling/importance_sampling_ratio/max": 2.6181864023208616,
"sampling/importance_sampling_ratio/mean": 0.969225960969925,
"sampling/importance_sampling_ratio/min": 0.029908512905240058,
"sampling/sampling_logp_difference/max": 0.7967680513858795,
"sampling/sampling_logp_difference/mean": 0.007359995786100626,
"step": 310,
"step_time": 10.448391663143411
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.030859375,
"completions/max_length": 1927.8,
"completions/max_terminated_length": 1774.6,
"completions/mean_length": 243.758984375,
"completions/mean_terminated_length": 187.3535903930664,
"completions/min_length": 56.2,
"completions/min_terminated_length": 56.2,
"entropy": 0.1740737314336002,
"epoch": 0.6852248394004282,
"frac_reward_zero_std": 0.5375,
"grad_norm": 0.64453125,
"learning_rate": 9.9681e-06,
"loss": -0.0205,
"num_tokens": 35065587.0,
"reward": 0.9232031464576721,
"reward_std": 0.37546863555908205,
"rewards/reward_accuracy/mean": 0.82578125,
"rewards/reward_accuracy/std": 0.3709150403738022,
"rewards/reward_format/mean": 0.09742187485098838,
"rewards/reward_format/std": 0.012454511737450958,
"sampling/importance_sampling_ratio/max": 2.53350989818573,
"sampling/importance_sampling_ratio/mean": 0.973149162530899,
"sampling/importance_sampling_ratio/min": 0.019597774744033812,
"sampling/sampling_logp_difference/max": 0.7022489726543426,
"sampling/sampling_logp_difference/mean": 0.0070005951449275015,
"step": 320,
"step_time": 9.585384701751172
},
{
"clip_ratio/high_max": 1.1748520046239719e-05,
"clip_ratio/high_mean": 1.4685650057799649e-06,
"clip_ratio/low_mean": 2.43531803789665e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.71209680956963e-06,
"completions/clipped_ratio": 0.034375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1883.2,
"completions/mean_length": 264.35,
"completions/mean_terminated_length": 201.17511291503905,
"completions/min_length": 59.2,
"completions/min_terminated_length": 59.2,
"entropy": 0.17365004699677228,
"epoch": 0.7066381156316917,
"frac_reward_zero_std": 0.55,
"grad_norm": 0.93359375,
"learning_rate": 9.9671e-06,
"loss": -0.0177,
"num_tokens": 36257187.0,
"reward": 0.9108984649181366,
"reward_std": 0.37933125495910647,
"rewards/reward_accuracy/mean": 0.8140625,
"rewards/reward_accuracy/std": 0.373566797375679,
"rewards/reward_format/mean": 0.09683593809604644,
"rewards/reward_format/std": 0.01464303294196725,
"sampling/importance_sampling_ratio/max": 2.486626124382019,
"sampling/importance_sampling_ratio/mean": 0.9737859606742859,
"sampling/importance_sampling_ratio/min": 0.008127313852310181,
"sampling/sampling_logp_difference/max": 0.5564516663551331,
"sampling/sampling_logp_difference/mean": 0.007042309362441301,
"step": 330,
"step_time": 10.344654870778323
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02734375,
"completions/max_length": 2004.2,
"completions/max_terminated_length": 1669.7,
"completions/mean_length": 240.04609375,
"completions/mean_terminated_length": 189.60863800048827,
"completions/min_length": 58.4,
"completions/min_terminated_length": 58.4,
"entropy": 0.1593780721537769,
"epoch": 0.728051391862955,
"frac_reward_zero_std": 0.65,
"grad_norm": 0.6484375,
"learning_rate": 9.966100000000001e-06,
"loss": -0.0086,
"num_tokens": 37388457.0,
"reward": 0.946191418170929,
"reward_std": 0.3363088212907314,
"rewards/reward_accuracy/mean": 0.848828125,
"rewards/reward_accuracy/std": 0.33088704720139506,
"rewards/reward_format/mean": 0.09736328348517417,
"rewards/reward_format/std": 0.01318122362717986,
"sampling/importance_sampling_ratio/max": 2.484243428707123,
"sampling/importance_sampling_ratio/mean": 0.9750512480735779,
"sampling/importance_sampling_ratio/min": 0.06507635908201337,
"sampling/sampling_logp_difference/max": 1.0773602604866028,
"sampling/sampling_logp_difference/mean": 0.0066701351199299095,
"step": 340,
"step_time": 9.722053058492019
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 4.0657213276062976e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.0657213276062976e-06,
"completions/clipped_ratio": 0.02578125,
"completions/max_length": 1986.1,
"completions/max_terminated_length": 1758.9,
"completions/mean_length": 243.049609375,
"completions/mean_terminated_length": 196.4989273071289,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"entropy": 0.156508687697351,
"epoch": 0.7494646680942184,
"frac_reward_zero_std": 0.56875,
"grad_norm": 0.443359375,
"learning_rate": 9.9651e-06,
"loss": -0.0255,
"num_tokens": 38525160.0,
"reward": 0.9014062762260437,
"reward_std": 0.3857307225465775,
"rewards/reward_accuracy/mean": 0.80390625,
"rewards/reward_accuracy/std": 0.38176355361938474,
"rewards/reward_format/mean": 0.09750000163912773,
"rewards/reward_format/std": 0.011372792162001133,
"sampling/importance_sampling_ratio/max": 2.3971022725105287,
"sampling/importance_sampling_ratio/mean": 0.9723467946052551,
"sampling/importance_sampling_ratio/min": 0.024745873548090457,
"sampling/sampling_logp_difference/max": 0.8578663825988769,
"sampling/sampling_logp_difference/mean": 0.006737873097881675,
"step": 350,
"step_time": 9.591641079029069
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.026171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1856.6,
"completions/mean_length": 249.4359375,
"completions/mean_terminated_length": 201.11819305419922,
"completions/min_length": 60.6,
"completions/min_terminated_length": 60.6,
"entropy": 0.1731101487763226,
"epoch": 0.7708779443254818,
"frac_reward_zero_std": 0.56875,
"grad_norm": 0.515625,
"learning_rate": 9.964100000000002e-06,
"loss": -0.0183,
"num_tokens": 39680164.0,
"reward": 0.913945347070694,
"reward_std": 0.38735567331314086,
"rewards/reward_accuracy/mean": 0.81640625,
"rewards/reward_accuracy/std": 0.3824517846107483,
"rewards/reward_format/mean": 0.09753906354308128,
"rewards/reward_format/std": 0.012624129373580217,
"sampling/importance_sampling_ratio/max": 2.374484491348267,
"sampling/importance_sampling_ratio/mean": 0.959593939781189,
"sampling/importance_sampling_ratio/min": 0.0,
"sampling/sampling_logp_difference/max": 0.8827651739120483,
"sampling/sampling_logp_difference/mean": 0.007277814205735922,
"step": 360,
"step_time": 10.163435412803665
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.032421875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1840.2,
"completions/mean_length": 280.035546875,
"completions/mean_terminated_length": 221.68175201416017,
"completions/min_length": 69.5,
"completions/min_terminated_length": 69.5,
"entropy": 0.1854695539921522,
"epoch": 0.7922912205567452,
"frac_reward_zero_std": 0.55625,
"grad_norm": 0.490234375,
"learning_rate": 9.963100000000001e-06,
"loss": -0.0137,
"num_tokens": 40921935.0,
"reward": 0.9070703446865082,
"reward_std": 0.3847604036331177,
"rewards/reward_accuracy/mean": 0.809765625,
"rewards/reward_accuracy/std": 0.38051430881023407,
"rewards/reward_format/mean": 0.09730469062924385,
"rewards/reward_format/std": 0.013218967290595175,
"sampling/importance_sampling_ratio/max": 2.6249274253845214,
"sampling/importance_sampling_ratio/mean": 0.971048891544342,
"sampling/importance_sampling_ratio/min": 0.028328332304954528,
"sampling/sampling_logp_difference/max": 0.739021098613739,
"sampling/sampling_logp_difference/mean": 0.00765662482008338,
"step": 370,
"step_time": 10.352117173140869
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01953125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1734.7,
"completions/mean_length": 257.50390625,
"completions/mean_terminated_length": 222.2868682861328,
"completions/min_length": 71.3,
"completions/min_terminated_length": 71.3,
"entropy": 0.17140506599098443,
"epoch": 0.8137044967880086,
"frac_reward_zero_std": 0.5625,
"grad_norm": 0.392578125,
"learning_rate": 9.9621e-06,
"loss": -0.01,
"num_tokens": 42102777.0,
"reward": 0.9027929961681366,
"reward_std": 0.39035768806934357,
"rewards/reward_accuracy/mean": 0.805078125,
"rewards/reward_accuracy/std": 0.3870938867330551,
"rewards/reward_format/mean": 0.09771484583616256,
"rewards/reward_format/std": 0.011916212178766728,
"sampling/importance_sampling_ratio/max": 2.500334119796753,
"sampling/importance_sampling_ratio/mean": 0.9583327412605286,
"sampling/importance_sampling_ratio/min": 0.028504961729049684,
"sampling/sampling_logp_difference/max": 0.8735279023647309,
"sampling/sampling_logp_difference/mean": 0.007211259100586176,
"step": 380,
"step_time": 9.588018673239276
},
{
"clip_ratio/high_max": 4.5843571570003405e-06,
"clip_ratio/high_mean": 5.730446446250426e-07,
"clip_ratio/low_mean": 2.916371659011929e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.4894163036369717e-06,
"completions/clipped_ratio": 0.0515625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1902.1,
"completions/mean_length": 347.1296875,
"completions/mean_terminated_length": 255.3552017211914,
"completions/min_length": 69.6,
"completions/min_terminated_length": 69.6,
"entropy": 0.20872693238779902,
"epoch": 0.8351177730192719,
"frac_reward_zero_std": 0.53125,
"grad_norm": 0.7890625,
"learning_rate": 9.961100000000002e-06,
"loss": -0.0178,
"num_tokens": 43512853.0,
"reward": 0.8889843940734863,
"reward_std": 0.3965169578790665,
"rewards/reward_accuracy/mean": 0.79375,
"rewards/reward_accuracy/std": 0.3892934888601303,
"rewards/reward_format/mean": 0.09523437544703484,
"rewards/reward_format/std": 0.017362049035727977,
"sampling/importance_sampling_ratio/max": 2.548991823196411,
"sampling/importance_sampling_ratio/mean": 0.9541543066501618,
"sampling/importance_sampling_ratio/min": 0.003933326341211796,
"sampling/sampling_logp_difference/max": 1.1129199504852294,
"sampling/sampling_logp_difference/mean": 0.007965518347918987,
"step": 390,
"step_time": 10.551881514443085
},
{
"clip_ratio/high_max": 3.838818520307541e-05,
"clip_ratio/high_mean": 4.798523150384426e-06,
"clip_ratio/low_mean": 1.3575270259025274e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 6.1560501762869535e-06,
"completions/clipped_ratio": 0.034765625,
"completions/max_length": 2027.3,
"completions/max_terminated_length": 1800.1,
"completions/mean_length": 305.10234375,
"completions/mean_terminated_length": 242.8255615234375,
"completions/min_length": 69.3,
"completions/min_terminated_length": 69.3,
"entropy": 0.18811013512313365,
"epoch": 0.8565310492505354,
"frac_reward_zero_std": 0.4875,
"grad_norm": 0.56640625,
"learning_rate": 9.9601e-06,
"loss": -0.0279,
"num_tokens": 44813483.0,
"reward": 0.9067383170127868,
"reward_std": 0.3815540254116058,
"rewards/reward_accuracy/mean": 0.81015625,
"rewards/reward_accuracy/std": 0.37652423679828645,
"rewards/reward_format/mean": 0.09658203199505806,
"rewards/reward_format/std": 0.014022546214982867,
"sampling/importance_sampling_ratio/max": 2.5536146640777586,
"sampling/importance_sampling_ratio/mean": 0.9643799722194671,
"sampling/importance_sampling_ratio/min": 0.04218380991369486,
"sampling/sampling_logp_difference/max": 0.8127229809761047,
"sampling/sampling_logp_difference/mean": 0.007687526987865567,
"step": 400,
"step_time": 10.01983220828697
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.038671875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1909.1,
"completions/mean_length": 325.069140625,
"completions/mean_terminated_length": 257.21341705322266,
"completions/min_length": 70.0,
"completions/min_terminated_length": 70.0,
"entropy": 0.1918898713774979,
"epoch": 0.8779443254817987,
"frac_reward_zero_std": 0.5,
"grad_norm": 0.67578125,
"learning_rate": 9.959100000000001e-06,
"loss": -0.0244,
"num_tokens": 46161708.0,
"reward": 0.9185351669788361,
"reward_std": 0.3770617499947548,
"rewards/reward_accuracy/mean": 0.823046875,
"rewards/reward_accuracy/std": 0.36939083486795427,
"rewards/reward_format/mean": 0.09548828303813935,
"rewards/reward_format/std": 0.01631742054596543,
"sampling/importance_sampling_ratio/max": 2.6512885093688965,
"sampling/importance_sampling_ratio/mean": 0.9551392495632172,
"sampling/importance_sampling_ratio/min": 0.0007175346370786428,
"sampling/sampling_logp_difference/max": 0.9529674530029297,
"sampling/sampling_logp_difference/mean": 0.007559870183467865,
"step": 410,
"step_time": 10.051076735369861
},
{
"clip_ratio/high_max": 8.81730520632118e-06,
"clip_ratio/high_mean": 1.1021631507901474e-06,
"clip_ratio/low_mean": 4.944620286551071e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.5966251794452546e-06,
"completions/clipped_ratio": 0.04140625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1977.0,
"completions/mean_length": 325.872265625,
"completions/mean_terminated_length": 252.52786865234376,
"completions/min_length": 72.4,
"completions/min_terminated_length": 72.4,
"entropy": 0.187678805552423,
"epoch": 0.8993576017130621,
"frac_reward_zero_std": 0.53125,
"grad_norm": 0.400390625,
"learning_rate": 9.9581e-06,
"loss": -0.0174,
"num_tokens": 47508197.0,
"reward": 0.9377343714237213,
"reward_std": 0.36066080033779147,
"rewards/reward_accuracy/mean": 0.841796875,
"rewards/reward_accuracy/std": 0.3541706711053848,
"rewards/reward_format/mean": 0.09593750014901162,
"rewards/reward_format/std": 0.015351274725981056,
"sampling/importance_sampling_ratio/max": 2.430267000198364,
"sampling/importance_sampling_ratio/mean": 0.9507900536060333,
"sampling/importance_sampling_ratio/min": 0.004503031075000763,
"sampling/sampling_logp_difference/max": 0.9439579486846924,
"sampling/sampling_logp_difference/mean": 0.0074990865308791396,
"step": 420,
"step_time": 10.541121458448469
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.032421875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1747.4,
"completions/mean_length": 277.1703125,
"completions/mean_terminated_length": 218.22617950439454,
"completions/min_length": 67.4,
"completions/min_terminated_length": 67.4,
"entropy": 0.1714092081412673,
"epoch": 0.9207708779443254,
"frac_reward_zero_std": 0.525,
"grad_norm": 0.52734375,
"learning_rate": 9.9571e-06,
"loss": -0.0192,
"num_tokens": 48731257.0,
"reward": 0.9036133170127869,
"reward_std": 0.3916765213012695,
"rewards/reward_accuracy/mean": 0.806640625,
"rewards/reward_accuracy/std": 0.387202051281929,
"rewards/reward_format/mean": 0.0969726599752903,
"rewards/reward_format/std": 0.014364734757691622,
"sampling/importance_sampling_ratio/max": 2.596026027202606,
"sampling/importance_sampling_ratio/mean": 0.9620015501976014,
"sampling/importance_sampling_ratio/min": 0.0063359834253788,
"sampling/sampling_logp_difference/max": 1.0208206593990325,
"sampling/sampling_logp_difference/mean": 0.007242908468469977,
"step": 430,
"step_time": 9.786764906905592
},
{
"clip_ratio/high_max": 2.01439735974418e-05,
"clip_ratio/high_mean": 2.517996699680225e-06,
"clip_ratio/low_mean": 9.739903816807782e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.4919871040983706e-06,
"completions/clipped_ratio": 0.0359375,
"completions/max_length": 2037.0,
"completions/max_terminated_length": 1688.6,
"completions/mean_length": 255.098828125,
"completions/mean_terminated_length": 189.12000274658203,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.15656299758702516,
"epoch": 0.9421841541755889,
"frac_reward_zero_std": 0.6125,
"grad_norm": 0.60546875,
"learning_rate": 9.956100000000001e-06,
"loss": -0.018,
"num_tokens": 49899350.0,
"reward": 0.9350195586681366,
"reward_std": 0.355120287835598,
"rewards/reward_accuracy/mean": 0.83828125,
"rewards/reward_accuracy/std": 0.3485265925526619,
"rewards/reward_format/mean": 0.09673828333616256,
"rewards/reward_format/std": 0.014138400694355369,
"sampling/importance_sampling_ratio/max": 2.481461238861084,
"sampling/importance_sampling_ratio/mean": 0.9668399870395661,
"sampling/importance_sampling_ratio/min": 0.01682160682976246,
"sampling/sampling_logp_difference/max": 0.9277780771255493,
"sampling/sampling_logp_difference/mean": 0.006879035336896777,
"step": 440,
"step_time": 10.007247812207789
},
{
"clip_ratio/high_max": 1.0415567885502242e-05,
"clip_ratio/high_mean": 1.3019459856877802e-06,
"clip_ratio/low_mean": 3.6564422316587297e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.95838821734651e-06,
"completions/clipped_ratio": 0.0453125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1920.9,
"completions/mean_length": 312.41484375,
"completions/mean_terminated_length": 230.57459869384766,
"completions/min_length": 68.8,
"completions/min_terminated_length": 68.8,
"entropy": 0.17350522577762603,
"epoch": 0.9635974304068522,
"frac_reward_zero_std": 0.5125,
"grad_norm": 0.453125,
"learning_rate": 9.9551e-06,
"loss": -0.0174,
"num_tokens": 51222972.0,
"reward": 0.8985351860523224,
"reward_std": 0.3932229146361351,
"rewards/reward_accuracy/mean": 0.803125,
"rewards/reward_accuracy/std": 0.38510433584451675,
"rewards/reward_format/mean": 0.09541015923023224,
"rewards/reward_format/std": 0.01737673571333289,
"sampling/importance_sampling_ratio/max": 2.64971067905426,
"sampling/importance_sampling_ratio/mean": 0.9680018961429596,
"sampling/importance_sampling_ratio/min": 0.028821493685245513,
"sampling/sampling_logp_difference/max": 0.9253865599632263,
"sampling/sampling_logp_difference/mean": 0.007327090157195926,
"step": 450,
"step_time": 10.35472412025556
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02890625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1748.4,
"completions/mean_length": 260.33203125,
"completions/mean_terminated_length": 207.88331909179686,
"completions/min_length": 70.2,
"completions/min_terminated_length": 70.2,
"entropy": 0.1579513200558722,
"epoch": 0.9850107066381156,
"frac_reward_zero_std": 0.53125,
"grad_norm": 0.58984375,
"learning_rate": 9.954100000000002e-06,
"loss": -0.0209,
"num_tokens": 52406174.0,
"reward": 0.9207422256469726,
"reward_std": 0.36950855404138566,
"rewards/reward_accuracy/mean": 0.823828125,
"rewards/reward_accuracy/std": 0.3641737073659897,
"rewards/reward_format/mean": 0.09691406562924385,
"rewards/reward_format/std": 0.01354732143227011,
"sampling/importance_sampling_ratio/max": 2.526651310920715,
"sampling/importance_sampling_ratio/mean": 0.9677818238735199,
"sampling/importance_sampling_ratio/min": 0.0559950752183795,
"sampling/sampling_logp_difference/max": 0.7780696809291839,
"sampling/sampling_logp_difference/mean": 0.0068999271839857105,
"step": 460,
"step_time": 9.815864898869767
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.021484375,
"completions/max_length": 1990.7,
"completions/max_terminated_length": 1844.0,
"completions/mean_length": 247.717578125,
"completions/mean_terminated_length": 208.5499008178711,
"completions/min_length": 71.5,
"completions/min_terminated_length": 71.5,
"entropy": 0.15766270095482468,
"epoch": 1.006423982869379,
"frac_reward_zero_std": 0.575,
"grad_norm": 0.4453125,
"learning_rate": 9.953100000000001e-06,
"loss": -0.0189,
"num_tokens": 53554299.0,
"reward": 0.943457055091858,
"reward_std": 0.35581323206424714,
"rewards/reward_accuracy/mean": 0.84609375,
"rewards/reward_accuracy/std": 0.3515170902013779,
"rewards/reward_format/mean": 0.09736328199505806,
"rewards/reward_format/std": 0.01258778024930507,
"sampling/importance_sampling_ratio/max": 2.5598071098327635,
"sampling/importance_sampling_ratio/mean": 0.9684597015380859,
"sampling/importance_sampling_ratio/min": 0.005463468376547098,
"sampling/sampling_logp_difference/max": 0.7644032418727875,
"sampling/sampling_logp_difference/mean": 0.0068299718201160434,
"step": 470,
"step_time": 9.484886160073803
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.035546875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1783.1,
"completions/mean_length": 282.96796875,
"completions/mean_terminated_length": 218.73411254882814,
"completions/min_length": 75.3,
"completions/min_terminated_length": 75.3,
"entropy": 0.17674043383449317,
"epoch": 1.0278372591006424,
"frac_reward_zero_std": 0.55,
"grad_norm": 0.90625,
"learning_rate": 9.9521e-06,
"loss": -0.0186,
"num_tokens": 54799017.0,
"reward": 0.9402929782867432,
"reward_std": 0.3594707578420639,
"rewards/reward_accuracy/mean": 0.844140625,
"rewards/reward_accuracy/std": 0.3525505632162094,
"rewards/reward_format/mean": 0.09615234509110451,
"rewards/reward_format/std": 0.01583651443943381,
"sampling/importance_sampling_ratio/max": 2.4566887855529784,
"sampling/importance_sampling_ratio/mean": 0.9579463243484497,
"sampling/importance_sampling_ratio/min": 0.004989023040980101,
"sampling/sampling_logp_difference/max": 0.6944355010986328,
"sampling/sampling_logp_difference/mean": 0.007241506455466151,
"step": 480,
"step_time": 10.14735255483538
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.049388305953471e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.049388305953471e-06,
"completions/clipped_ratio": 0.034375,
"completions/max_length": 2007.8,
"completions/max_terminated_length": 1811.7,
"completions/mean_length": 253.495703125,
"completions/mean_terminated_length": 189.98597869873046,
"completions/min_length": 66.4,
"completions/min_terminated_length": 66.4,
"entropy": 0.16617674194276333,
"epoch": 1.0492505353319057,
"frac_reward_zero_std": 0.56875,
"grad_norm": 0.69921875,
"learning_rate": 9.951100000000002e-06,
"loss": -0.0094,
"num_tokens": 55965678.0,
"reward": 0.9102344214916229,
"reward_std": 0.3847487300634384,
"rewards/reward_accuracy/mean": 0.813671875,
"rewards/reward_accuracy/std": 0.378129655122757,
"rewards/reward_format/mean": 0.09656250104308128,
"rewards/reward_format/std": 0.015593840973451734,
"sampling/importance_sampling_ratio/max": 2.498990845680237,
"sampling/importance_sampling_ratio/mean": 0.9665201961994171,
"sampling/importance_sampling_ratio/min": 0.007892926782369613,
"sampling/sampling_logp_difference/max": 0.7775724828243256,
"sampling/sampling_logp_difference/mean": 0.007170763006433845,
"step": 490,
"step_time": 9.943986208271236
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.4390127464357647e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.4390127464357647e-06,
"completions/clipped_ratio": 0.02265625,
"completions/max_length": 2045.2,
"completions/max_terminated_length": 1822.0,
"completions/mean_length": 232.826171875,
"completions/mean_terminated_length": 191.10270233154296,
"completions/min_length": 69.5,
"completions/min_terminated_length": 69.5,
"entropy": 0.15125867817550898,
"epoch": 1.0706638115631693,
"frac_reward_zero_std": 0.58125,
"grad_norm": 0.7265625,
"learning_rate": 9.9501e-06,
"loss": -0.026,
"num_tokens": 57079697.0,
"reward": 0.939238303899765,
"reward_std": 0.34797793328762056,
"rewards/reward_accuracy/mean": 0.841796875,
"rewards/reward_accuracy/std": 0.34288529753685,
"rewards/reward_format/mean": 0.09744140803813935,
"rewards/reward_format/std": 0.012741397391073406,
"sampling/importance_sampling_ratio/max": 2.255339705944061,
"sampling/importance_sampling_ratio/mean": 0.9672765374183655,
"sampling/importance_sampling_ratio/min": 0.06362132839858532,
"sampling/sampling_logp_difference/max": 0.7051827192306519,
"sampling/sampling_logp_difference/mean": 0.006754382792860269,
"step": 500,
"step_time": 9.722729661036283
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012890625,
"completions/max_length": 1836.0,
"completions/max_terminated_length": 1516.0,
"completions/mean_length": 202.510546875,
"completions/mean_terminated_length": 178.56044006347656,
"completions/min_length": 70.6,
"completions/min_terminated_length": 70.6,
"entropy": 0.13655630815774203,
"epoch": 1.0920770877944326,
"frac_reward_zero_std": 0.6,
"grad_norm": 0.8359375,
"learning_rate": 9.949100000000001e-06,
"loss": -0.0061,
"num_tokens": 58122620.0,
"reward": 0.9682226717472077,
"reward_std": 0.333330275118351,
"rewards/reward_accuracy/mean": 0.86953125,
"rewards/reward_accuracy/std": 0.33052612394094466,
"rewards/reward_format/mean": 0.09869140908122062,
"rewards/reward_format/std": 0.009017979027703404,
"sampling/importance_sampling_ratio/max": 2.6004796743392946,
"sampling/importance_sampling_ratio/mean": 0.9905089139938354,
"sampling/importance_sampling_ratio/min": 0.12283982932567597,
"sampling/sampling_logp_difference/max": 0.7029530525207519,
"sampling/sampling_logp_difference/mean": 0.006430687848478556,
"step": 510,
"step_time": 8.651938113430514
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01953125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1789.1,
"completions/mean_length": 234.337109375,
"completions/mean_terminated_length": 198.20711822509764,
"completions/min_length": 70.9,
"completions/min_terminated_length": 70.9,
"entropy": 0.15276043806225062,
"epoch": 1.113490364025696,
"frac_reward_zero_std": 0.6125,
"grad_norm": 0.69921875,
"learning_rate": 9.9481e-06,
"loss": -0.0184,
"num_tokens": 59239675.0,
"reward": 0.9490429937839509,
"reward_std": 0.3499227106571198,
"rewards/reward_accuracy/mean": 0.851171875,
"rewards/reward_accuracy/std": 0.3454223096370697,
"rewards/reward_format/mean": 0.0978710949420929,
"rewards/reward_format/std": 0.011833475576713682,
"sampling/importance_sampling_ratio/max": 2.3916098356246946,
"sampling/importance_sampling_ratio/mean": 0.9649648070335388,
"sampling/importance_sampling_ratio/min": 0.030473802238702774,
"sampling/sampling_logp_difference/max": 0.6736026883125306,
"sampling/sampling_logp_difference/mean": 0.006766516668722034,
"step": 520,
"step_time": 9.737047488987447
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.019140625,
"completions/max_length": 1877.8,
"completions/max_terminated_length": 1586.6,
"completions/mean_length": 244.138671875,
"completions/mean_terminated_length": 209.54840393066405,
"completions/min_length": 74.5,
"completions/min_terminated_length": 74.5,
"entropy": 0.14895990611985327,
"epoch": 1.1349036402569592,
"frac_reward_zero_std": 0.625,
"grad_norm": 0.64453125,
"learning_rate": 9.9471e-06,
"loss": -0.0068,
"num_tokens": 60385726.0,
"reward": 0.9239844083786011,
"reward_std": 0.3754288852214813,
"rewards/reward_accuracy/mean": 0.82578125,
"rewards/reward_accuracy/std": 0.37216812670230864,
"rewards/reward_format/mean": 0.0982031248509884,
"rewards/reward_format/std": 0.010030061751604081,
"sampling/importance_sampling_ratio/max": 2.5723390102386476,
"sampling/importance_sampling_ratio/mean": 0.9725699186325073,
"sampling/importance_sampling_ratio/min": 0.048116151988506314,
"sampling/sampling_logp_difference/max": 0.6766499698162078,
"sampling/sampling_logp_difference/mean": 0.006519828783348202,
"step": 530,
"step_time": 9.075996103417129
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.020703125,
"completions/max_length": 2038.5,
"completions/max_terminated_length": 1890.6,
"completions/mean_length": 255.322265625,
"completions/mean_terminated_length": 218.3919464111328,
"completions/min_length": 73.9,
"completions/min_terminated_length": 73.9,
"entropy": 0.1585966265760362,
"epoch": 1.1563169164882228,
"frac_reward_zero_std": 0.59375,
"grad_norm": 0.70703125,
"learning_rate": 9.946100000000001e-06,
"loss": -0.0213,
"num_tokens": 61555591.0,
"reward": 0.9469140768051147,
"reward_std": 0.3444708287715912,
"rewards/reward_accuracy/mean": 0.84921875,
"rewards/reward_accuracy/std": 0.3408248633146286,
"rewards/reward_format/mean": 0.09769531339406967,
"rewards/reward_format/std": 0.011227904516272248,
"sampling/importance_sampling_ratio/max": 2.6657587051391602,
"sampling/importance_sampling_ratio/mean": 0.9695823192596436,
"sampling/importance_sampling_ratio/min": 0.026576372142881156,
"sampling/sampling_logp_difference/max": 0.7909226059913635,
"sampling/sampling_logp_difference/mean": 0.006891067046672106,
"step": 540,
"step_time": 9.791422115033493
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.736554642979172e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.736554642979172e-06,
"completions/clipped_ratio": 0.03046875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1733.8,
"completions/mean_length": 266.4078125,
"completions/mean_terminated_length": 210.98098754882812,
"completions/min_length": 75.7,
"completions/min_terminated_length": 75.7,
"entropy": 0.1736724109388888,
"epoch": 1.177730192719486,
"frac_reward_zero_std": 0.575,
"grad_norm": 0.75,
"learning_rate": 9.9451e-06,
"loss": -0.0225,
"num_tokens": 62753067.0,
"reward": 0.9583398640155792,
"reward_std": 0.3437022387981415,
"rewards/reward_accuracy/mean": 0.8609375,
"rewards/reward_accuracy/std": 0.3383584558963776,
"rewards/reward_format/mean": 0.09740234613418579,
"rewards/reward_format/std": 0.012713893176987767,
"sampling/importance_sampling_ratio/max": 2.535644018650055,
"sampling/importance_sampling_ratio/mean": 0.9694399416446686,
"sampling/importance_sampling_ratio/min": 0.0279288150370121,
"sampling/sampling_logp_difference/max": 1.079693728685379,
"sampling/sampling_logp_difference/mean": 0.0071603016462177035,
"step": 550,
"step_time": 9.984118106076494
},
{
"clip_ratio/high_max": 8.11161589808762e-06,
"clip_ratio/high_mean": 1.0139519872609526e-06,
"clip_ratio/low_mean": 3.5927798762713793e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.3732299748880905e-06,
"completions/clipped_ratio": 0.012109375,
"completions/max_length": 1985.6,
"completions/max_terminated_length": 1619.3,
"completions/mean_length": 190.095703125,
"completions/mean_terminated_length": 167.40203704833985,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.12261172058060765,
"epoch": 1.1991434689507494,
"frac_reward_zero_std": 0.68125,
"grad_norm": 0.54296875,
"learning_rate": 9.9441e-06,
"loss": -0.0086,
"num_tokens": 63751072.0,
"reward": 0.9855273425579071,
"reward_std": 0.31273077577352526,
"rewards/reward_accuracy/mean": 0.88671875,
"rewards/reward_accuracy/std": 0.30950316935777666,
"rewards/reward_format/mean": 0.09880859479308128,
"rewards/reward_format/std": 0.008623425848782063,
"sampling/importance_sampling_ratio/max": 2.364128589630127,
"sampling/importance_sampling_ratio/mean": 0.9759804785251618,
"sampling/importance_sampling_ratio/min": 0.0711412861943245,
"sampling/sampling_logp_difference/max": 0.7094807982444763,
"sampling/sampling_logp_difference/mean": 0.0057958280202001335,
"step": 560,
"step_time": 9.401468964433297
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.023828125,
"completions/max_length": 2002.1,
"completions/max_terminated_length": 1700.1,
"completions/mean_length": 246.259765625,
"completions/mean_terminated_length": 202.88703308105468,
"completions/min_length": 71.3,
"completions/min_terminated_length": 71.3,
"entropy": 0.15033167283982038,
"epoch": 1.2205567451820127,
"frac_reward_zero_std": 0.6125,
"grad_norm": 0.69140625,
"learning_rate": 9.943100000000001e-06,
"loss": -0.0275,
"num_tokens": 64903225.0,
"reward": 0.9204687893390655,
"reward_std": 0.3749256819486618,
"rewards/reward_accuracy/mean": 0.82265625,
"rewards/reward_accuracy/std": 0.3708346337080002,
"rewards/reward_format/mean": 0.09781250283122063,
"rewards/reward_format/std": 0.011215825006365776,
"sampling/importance_sampling_ratio/max": 2.493147075176239,
"sampling/importance_sampling_ratio/mean": 0.9698342263698578,
"sampling/importance_sampling_ratio/min": 0.01973040485754609,
"sampling/sampling_logp_difference/max": 0.6820814609527588,
"sampling/sampling_logp_difference/mean": 0.006548658199608326,
"step": 570,
"step_time": 9.721093765785918
},
{
"clip_ratio/high_max": 2.588718562037684e-05,
"clip_ratio/high_mean": 3.235898202547105e-06,
"clip_ratio/low_mean": 1.8103213733411393e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 5.046219575888244e-06,
"completions/clipped_ratio": 0.026171875,
"completions/max_length": 2008.8,
"completions/max_terminated_length": 1821.4,
"completions/mean_length": 241.70859375,
"completions/mean_terminated_length": 193.46966094970702,
"completions/min_length": 60.5,
"completions/min_terminated_length": 60.5,
"entropy": 0.15281236721202732,
"epoch": 1.2419700214132763,
"frac_reward_zero_std": 0.575,
"grad_norm": 0.5390625,
"learning_rate": 9.942100000000001e-06,
"loss": -0.02,
"num_tokens": 66034719.0,
"reward": 0.9504297137260437,
"reward_std": 0.34881015717983244,
"rewards/reward_accuracy/mean": 0.852734375,
"rewards/reward_accuracy/std": 0.3446532905101776,
"rewards/reward_format/mean": 0.09769531339406967,
"rewards/reward_format/std": 0.01135781672783196,
"sampling/importance_sampling_ratio/max": 2.261395752429962,
"sampling/importance_sampling_ratio/mean": 0.9655756533145905,
"sampling/importance_sampling_ratio/min": 0.029139625281095503,
"sampling/sampling_logp_difference/max": 0.6548515439033509,
"sampling/sampling_logp_difference/mean": 0.00650896318256855,
"step": 580,
"step_time": 10.07621797202155
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.027734375,
"completions/max_length": 2033.9,
"completions/max_terminated_length": 1799.5,
"completions/mean_length": 236.78671875,
"completions/mean_terminated_length": 185.28022003173828,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.1513898684643209,
"epoch": 1.2633832976445396,
"frac_reward_zero_std": 0.6625,
"grad_norm": 0.337890625,
"learning_rate": 9.941100000000002e-06,
"loss": -0.0209,
"num_tokens": 67153693.0,
"reward": 0.9791406512260437,
"reward_std": 0.3156343370676041,
"rewards/reward_accuracy/mean": 0.88125,
"rewards/reward_accuracy/std": 0.3117549866437912,
"rewards/reward_format/mean": 0.09789062514901162,
"rewards/reward_format/std": 0.010850324272178113,
"sampling/importance_sampling_ratio/max": 2.593677306175232,
"sampling/importance_sampling_ratio/mean": 0.9713839232921601,
"sampling/importance_sampling_ratio/min": 0.022237093560397624,
"sampling/sampling_logp_difference/max": 0.6016359806060791,
"sampling/sampling_logp_difference/mean": 0.006623369408771396,
"step": 590,
"step_time": 10.035956812649966
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01953125,
"completions/max_length": 1973.6,
"completions/max_terminated_length": 1831.1,
"completions/mean_length": 220.371875,
"completions/mean_terminated_length": 184.33446350097657,
"completions/min_length": 70.6,
"completions/min_terminated_length": 70.6,
"entropy": 0.14282382102683186,
"epoch": 1.284796573875803,
"frac_reward_zero_std": 0.625,
"grad_norm": 0.625,
"learning_rate": 9.9401e-06,
"loss": -0.0127,
"num_tokens": 68223349.0,
"reward": 0.9734765887260437,
"reward_std": 0.32734766900539397,
"rewards/reward_accuracy/mean": 0.87578125,
"rewards/reward_accuracy/std": 0.32240096032619475,
"rewards/reward_format/mean": 0.09769531488418579,
"rewards/reward_format/std": 0.011307045398280025,
"sampling/importance_sampling_ratio/max": 2.5867155313491823,
"sampling/importance_sampling_ratio/mean": 0.9762231826782226,
"sampling/importance_sampling_ratio/min": 0.056274252105504276,
"sampling/sampling_logp_difference/max": 0.7129928708076477,
"sampling/sampling_logp_difference/mean": 0.006264035031199456,
"step": 600,
"step_time": 9.602599639073015
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.021875,
"completions/max_length": 1990.9,
"completions/max_terminated_length": 1825.0,
"completions/mean_length": 233.9765625,
"completions/mean_terminated_length": 193.8284149169922,
"completions/min_length": 71.4,
"completions/min_terminated_length": 71.4,
"entropy": 0.13670694502070546,
"epoch": 1.3062098501070665,
"frac_reward_zero_std": 0.6125,
"grad_norm": 0.58203125,
"learning_rate": 9.939100000000001e-06,
"loss": -0.0174,
"num_tokens": 69340713.0,
"reward": 0.9569922089576721,
"reward_std": 0.34578508138656616,
"rewards/reward_accuracy/mean": 0.859375,
"rewards/reward_accuracy/std": 0.3406145006418228,
"rewards/reward_format/mean": 0.09761718809604644,
"rewards/reward_format/std": 0.0111768061760813,
"sampling/importance_sampling_ratio/max": 2.4745423913002016,
"sampling/importance_sampling_ratio/mean": 0.9789625883102417,
"sampling/importance_sampling_ratio/min": 0.03890752345323563,
"sampling/sampling_logp_difference/max": 0.8054025352001191,
"sampling/sampling_logp_difference/mean": 0.006173065025359392,
"step": 610,
"step_time": 9.595619960594922
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.019140625,
"completions/max_length": 2043.4,
"completions/max_terminated_length": 1826.8,
"completions/mean_length": 223.5265625,
"completions/mean_terminated_length": 188.2144790649414,
"completions/min_length": 70.3,
"completions/min_terminated_length": 70.3,
"entropy": 0.13695236938074232,
"epoch": 1.3276231263383298,
"frac_reward_zero_std": 0.6125,
"grad_norm": 0.63671875,
"learning_rate": 9.9381e-06,
"loss": -0.0084,
"num_tokens": 70425197.0,
"reward": 0.9467578232288361,
"reward_std": 0.35667126476764677,
"rewards/reward_accuracy/mean": 0.848828125,
"rewards/reward_accuracy/std": 0.3527708947658539,
"rewards/reward_format/mean": 0.09792968928813935,
"rewards/reward_format/std": 0.01060937091242522,
"sampling/importance_sampling_ratio/max": 2.4067316889762878,
"sampling/importance_sampling_ratio/mean": 0.9851578593254089,
"sampling/importance_sampling_ratio/min": 0.0465527355670929,
"sampling/sampling_logp_difference/max": 0.7730030059814453,
"sampling/sampling_logp_difference/mean": 0.006319962162524462,
"step": 620,
"step_time": 9.777248504851013
},
{
"clip_ratio/high_max": 2.545488314353861e-05,
"clip_ratio/high_mean": 3.181860392942326e-06,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.181860392942326e-06,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 1891.0,
"completions/max_terminated_length": 1609.1,
"completions/mean_length": 273.0171875,
"completions/mean_terminated_length": 216.49644775390624,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.15398789923638107,
"epoch": 1.3490364025695931,
"frac_reward_zero_std": 0.59375,
"grad_norm": 0.7109375,
"learning_rate": 9.9371e-06,
"loss": -0.0101,
"num_tokens": 71642201.0,
"reward": 0.9106640756130219,
"reward_std": 0.3642830580472946,
"rewards/reward_accuracy/mean": 0.813671875,
"rewards/reward_accuracy/std": 0.35935564115643504,
"rewards/reward_format/mean": 0.09699218794703483,
"rewards/reward_format/std": 0.013189932238310576,
"sampling/importance_sampling_ratio/max": 2.5063803434371947,
"sampling/importance_sampling_ratio/mean": 0.9609185636043549,
"sampling/importance_sampling_ratio/min": 0.038018787279725075,
"sampling/sampling_logp_difference/max": 0.8188849091529846,
"sampling/sampling_logp_difference/mean": 0.006627660803496837,
"step": 630,
"step_time": 9.675742756854742
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0171875,
"completions/max_length": 2046.6,
"completions/max_terminated_length": 1712.3,
"completions/mean_length": 233.844921875,
"completions/mean_terminated_length": 202.36591339111328,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.1377914204262197,
"epoch": 1.3704496788008567,
"frac_reward_zero_std": 0.65625,
"grad_norm": 0.447265625,
"learning_rate": 9.936100000000001e-06,
"loss": -0.0102,
"num_tokens": 72760060.0,
"reward": 0.9477539420127868,
"reward_std": 0.3499771744012833,
"rewards/reward_accuracy/mean": 0.849609375,
"rewards/reward_accuracy/std": 0.34618692100048065,
"rewards/reward_format/mean": 0.09814453274011611,
"rewards/reward_format/std": 0.009887455636635423,
"sampling/importance_sampling_ratio/max": 2.5645956993103027,
"sampling/importance_sampling_ratio/mean": 0.9841652810573578,
"sampling/importance_sampling_ratio/min": 0.03556144703179598,
"sampling/sampling_logp_difference/max": 0.6438291549682618,
"sampling/sampling_logp_difference/mean": 0.0062292659189552065,
"step": 640,
"step_time": 9.657860070979222
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0140625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1795.9,
"completions/mean_length": 230.2125,
"completions/mean_terminated_length": 204.4558563232422,
"completions/min_length": 69.1,
"completions/min_terminated_length": 69.1,
"entropy": 0.14571338426321745,
"epoch": 1.39186295503212,
"frac_reward_zero_std": 0.575,
"grad_norm": 0.54296875,
"learning_rate": 9.9351e-06,
"loss": -0.0211,
"num_tokens": 73869308.0,
"reward": 0.931914097070694,
"reward_std": 0.3535457715392113,
"rewards/reward_accuracy/mean": 0.83359375,
"rewards/reward_accuracy/std": 0.35077162384986876,
"rewards/reward_format/mean": 0.09832031354308128,
"rewards/reward_format/std": 0.009559615980833769,
"sampling/importance_sampling_ratio/max": 2.514175844192505,
"sampling/importance_sampling_ratio/mean": 0.9772779464721679,
"sampling/importance_sampling_ratio/min": 0.04472700320184231,
"sampling/sampling_logp_difference/max": 0.908085036277771,
"sampling/sampling_logp_difference/mean": 0.006749674072489142,
"step": 650,
"step_time": 9.650849735969677
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1691.0,
"completions/max_terminated_length": 1369.5,
"completions/mean_length": 176.23046875,
"completions/mean_terminated_length": 166.0182846069336,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.10370169095695018,
"epoch": 1.4132762312633833,
"frac_reward_zero_std": 0.6,
"grad_norm": 0.9296875,
"learning_rate": 9.9341e-06,
"loss": -0.0131,
"num_tokens": 74833018.0,
"reward": 0.9841015875339508,
"reward_std": 0.30473026558756827,
"rewards/reward_accuracy/mean": 0.884765625,
"rewards/reward_accuracy/std": 0.3034436784684658,
"rewards/reward_format/mean": 0.0993359386920929,
"rewards/reward_format/std": 0.005197879136539995,
"sampling/importance_sampling_ratio/max": 2.4016508936882017,
"sampling/importance_sampling_ratio/mean": 0.9813492953777313,
"sampling/importance_sampling_ratio/min": 0.06504318906227127,
"sampling/sampling_logp_difference/max": 0.7964857578277588,
"sampling/sampling_logp_difference/mean": 0.005476095108315348,
"step": 660,
"step_time": 8.012326097209007
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0171875,
"completions/max_length": 2045.7,
"completions/max_terminated_length": 1836.7,
"completions/mean_length": 247.865625,
"completions/mean_terminated_length": 216.75238800048828,
"completions/min_length": 79.7,
"completions/min_terminated_length": 79.7,
"entropy": 0.1431811224669218,
"epoch": 1.4346895074946466,
"frac_reward_zero_std": 0.5375,
"grad_norm": 0.578125,
"learning_rate": 9.933100000000002e-06,
"loss": -0.0182,
"num_tokens": 75987810.0,
"reward": 0.9188086271286011,
"reward_std": 0.3797665983438492,
"rewards/reward_accuracy/mean": 0.820703125,
"rewards/reward_accuracy/std": 0.376504048705101,
"rewards/reward_format/mean": 0.09810546934604644,
"rewards/reward_format/std": 0.010662907687947153,
"sampling/importance_sampling_ratio/max": 2.491010880470276,
"sampling/importance_sampling_ratio/mean": 0.9624502241611481,
"sampling/importance_sampling_ratio/min": 0.019045909866690636,
"sampling/sampling_logp_difference/max": 1.0775641560554505,
"sampling/sampling_logp_difference/mean": 0.006694463174790144,
"step": 670,
"step_time": 9.739212415413931
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0265625,
"completions/max_length": 2022.2,
"completions/max_terminated_length": 1767.7,
"completions/mean_length": 267.8890625,
"completions/mean_terminated_length": 219.78734436035157,
"completions/min_length": 77.9,
"completions/min_terminated_length": 77.9,
"entropy": 0.13868142189458013,
"epoch": 1.45610278372591,
"frac_reward_zero_std": 0.59375,
"grad_norm": 0.5546875,
"learning_rate": 9.932100000000001e-06,
"loss": -0.0187,
"num_tokens": 77196742.0,
"reward": 0.8865039229393006,
"reward_std": 0.4072133004665375,
"rewards/reward_accuracy/mean": 0.788671875,
"rewards/reward_accuracy/std": 0.4035623610019684,
"rewards/reward_format/mean": 0.09783203229308128,
"rewards/reward_format/std": 0.011461964668706059,
"sampling/importance_sampling_ratio/max": 2.729620122909546,
"sampling/importance_sampling_ratio/mean": 0.9661240994930267,
"sampling/importance_sampling_ratio/min": 0.034035885240882635,
"sampling/sampling_logp_difference/max": 0.7037467956542969,
"sampling/sampling_logp_difference/mean": 0.0065780739765614275,
"step": 680,
"step_time": 9.795271350443363
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.026953125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1675.4,
"completions/mean_length": 285.02109375,
"completions/mean_terminated_length": 237.00460052490234,
"completions/min_length": 74.1,
"completions/min_terminated_length": 74.1,
"entropy": 0.15429682563990355,
"epoch": 1.4775160599571735,
"frac_reward_zero_std": 0.5875,
"grad_norm": 0.99609375,
"learning_rate": 9.9311e-06,
"loss": -0.0133,
"num_tokens": 78442332.0,
"reward": 0.9418945610523224,
"reward_std": 0.35663125813007357,
"rewards/reward_accuracy/mean": 0.84453125,
"rewards/reward_accuracy/std": 0.35166865587234497,
"rewards/reward_format/mean": 0.09736328199505806,
"rewards/reward_format/std": 0.013331192033365368,
"sampling/importance_sampling_ratio/max": 2.44986355304718,
"sampling/importance_sampling_ratio/mean": 0.9779297828674316,
"sampling/importance_sampling_ratio/min": 0.02454649955034256,
"sampling/sampling_logp_difference/max": 0.7294579923152924,
"sampling/sampling_logp_difference/mean": 0.006937016034498811,
"step": 690,
"step_time": 10.016294634807855
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.025,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1769.2,
"completions/mean_length": 253.318359375,
"completions/mean_terminated_length": 207.69876403808593,
"completions/min_length": 75.4,
"completions/min_terminated_length": 75.4,
"entropy": 0.14746147403493523,
"epoch": 1.4989293361884368,
"frac_reward_zero_std": 0.5625,
"grad_norm": 1.03125,
"learning_rate": 9.9301e-06,
"loss": -0.0124,
"num_tokens": 79603563.0,
"reward": 0.9756836116313934,
"reward_std": 0.32087922394275664,
"rewards/reward_accuracy/mean": 0.877734375,
"rewards/reward_accuracy/std": 0.3165073648095131,
"rewards/reward_format/mean": 0.09794921800494194,
"rewards/reward_format/std": 0.010957276029512287,
"sampling/importance_sampling_ratio/max": 2.619251751899719,
"sampling/importance_sampling_ratio/mean": 0.962170022726059,
"sampling/importance_sampling_ratio/min": 0.0029962314292788506,
"sampling/sampling_logp_difference/max": 0.7355899095535279,
"sampling/sampling_logp_difference/mean": 0.0069349154364317656,
"step": 700,
"step_time": 9.907826334238052
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0265625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1939.5,
"completions/mean_length": 270.900390625,
"completions/mean_terminated_length": 222.5992218017578,
"completions/min_length": 78.5,
"completions/min_terminated_length": 78.5,
"entropy": 0.1445523993112147,
"epoch": 1.5203426124197001,
"frac_reward_zero_std": 0.59375,
"grad_norm": 0.69921875,
"learning_rate": 9.929100000000001e-06,
"loss": -0.0173,
"num_tokens": 80820844.0,
"reward": 0.9514648795127869,
"reward_std": 0.3500185519456863,
"rewards/reward_accuracy/mean": 0.85390625,
"rewards/reward_accuracy/std": 0.3444949328899384,
"rewards/reward_format/mean": 0.09755859449505806,
"rewards/reward_format/std": 0.013312468491494655,
"sampling/importance_sampling_ratio/max": 2.4151892185211183,
"sampling/importance_sampling_ratio/mean": 0.9611580729484558,
"sampling/importance_sampling_ratio/min": 0.0062289898283779625,
"sampling/sampling_logp_difference/max": 0.9092877089977265,
"sampling/sampling_logp_difference/mean": 0.006728888396173716,
"step": 710,
"step_time": 10.154783984972164
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.3490224091583513e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.3490224091583513e-06,
"completions/clipped_ratio": 0.039453125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1902.7,
"completions/mean_length": 316.194921875,
"completions/mean_terminated_length": 245.35125579833985,
"completions/min_length": 74.5,
"completions/min_terminated_length": 74.5,
"entropy": 0.1705155328847468,
"epoch": 1.5417558886509637,
"frac_reward_zero_std": 0.575,
"grad_norm": 0.33203125,
"learning_rate": 9.9281e-06,
"loss": -0.0181,
"num_tokens": 82149023.0,
"reward": 0.9240625202655792,
"reward_std": 0.3773770064115524,
"rewards/reward_accuracy/mean": 0.827734375,
"rewards/reward_accuracy/std": 0.3702928006649017,
"rewards/reward_format/mean": 0.09632812514901161,
"rewards/reward_format/std": 0.016026155557483435,
"sampling/importance_sampling_ratio/max": 2.5802762508392334,
"sampling/importance_sampling_ratio/mean": 0.9627854526042938,
"sampling/importance_sampling_ratio/min": 0.0058822366409003735,
"sampling/sampling_logp_difference/max": 0.8497748136520386,
"sampling/sampling_logp_difference/mean": 0.007133919233456254,
"step": 720,
"step_time": 10.588756273407489
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.4714056053198876e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.4714056053198876e-06,
"completions/clipped_ratio": 0.038671875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1919.0,
"completions/mean_length": 302.79140625,
"completions/mean_terminated_length": 232.5045166015625,
"completions/min_length": 72.6,
"completions/min_terminated_length": 72.6,
"entropy": 0.1628550361841917,
"epoch": 1.563169164882227,
"frac_reward_zero_std": 0.5875,
"grad_norm": 0.828125,
"learning_rate": 9.9271e-06,
"loss": -0.0234,
"num_tokens": 83456409.0,
"reward": 0.9477734744548798,
"reward_std": 0.3556057929992676,
"rewards/reward_accuracy/mean": 0.851171875,
"rewards/reward_accuracy/std": 0.3483373522758484,
"rewards/reward_format/mean": 0.0966015636920929,
"rewards/reward_format/std": 0.01595138506963849,
"sampling/importance_sampling_ratio/max": 2.6308526277542112,
"sampling/importance_sampling_ratio/mean": 0.9608778595924378,
"sampling/importance_sampling_ratio/min": 0.021300735976547004,
"sampling/sampling_logp_difference/max": 0.9817075669765473,
"sampling/sampling_logp_difference/mean": 0.0069509056396782395,
"step": 730,
"step_time": 10.55201198188588
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.023828125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1773.1,
"completions/mean_length": 246.20703125,
"completions/mean_terminated_length": 202.32059173583986,
"completions/min_length": 70.9,
"completions/min_terminated_length": 70.9,
"entropy": 0.14194792918860913,
"epoch": 1.5845824411134903,
"frac_reward_zero_std": 0.68125,
"grad_norm": 0.68359375,
"learning_rate": 9.926100000000001e-06,
"loss": 0.0018,
"num_tokens": 84598843.0,
"reward": 0.9639062702655792,
"reward_std": 0.3331055447459221,
"rewards/reward_accuracy/mean": 0.866015625,
"rewards/reward_accuracy/std": 0.3279029086232185,
"rewards/reward_format/mean": 0.09789062663912773,
"rewards/reward_format/std": 0.011608744971454144,
"sampling/importance_sampling_ratio/max": 2.6042314529418946,
"sampling/importance_sampling_ratio/mean": 0.9882521092891693,
"sampling/importance_sampling_ratio/min": 0.045009415270760654,
"sampling/sampling_logp_difference/max": 0.9613821625709533,
"sampling/sampling_logp_difference/mean": 0.006303771398961544,
"step": 740,
"step_time": 9.92973174736835
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.016015625,
"completions/max_length": 1724.5,
"completions/max_terminated_length": 1226.1,
"completions/mean_length": 211.36953125,
"completions/mean_terminated_length": 181.9163024902344,
"completions/min_length": 68.6,
"completions/min_terminated_length": 68.6,
"entropy": 0.12029059575870633,
"epoch": 1.6059957173447539,
"frac_reward_zero_std": 0.64375,
"grad_norm": 0.71484375,
"learning_rate": 9.925100000000001e-06,
"loss": -0.014,
"num_tokens": 85661373.0,
"reward": 0.9430078268051147,
"reward_std": 0.34315127581357957,
"rewards/reward_accuracy/mean": 0.84453125,
"rewards/reward_accuracy/std": 0.3400998875498772,
"rewards/reward_format/mean": 0.0984765648841858,
"rewards/reward_format/std": 0.00880467644892633,
"sampling/importance_sampling_ratio/max": 2.446712839603424,
"sampling/importance_sampling_ratio/mean": 0.9789796471595764,
"sampling/importance_sampling_ratio/min": 0.09210466668009758,
"sampling/sampling_logp_difference/max": 0.7732061445713043,
"sampling/sampling_logp_difference/mean": 0.005752146430313587,
"step": 750,
"step_time": 8.326591362664477
},
{
"clip_ratio/high_max": 1.9942833750974388e-05,
"clip_ratio/high_mean": 2.4928542188717985e-06,
"clip_ratio/low_mean": 6.299133019638248e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.1227675208356233e-06,
"completions/clipped_ratio": 0.019140625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1889.5,
"completions/mean_length": 230.280859375,
"completions/mean_terminated_length": 194.9323959350586,
"completions/min_length": 70.6,
"completions/min_terminated_length": 70.6,
"entropy": 0.13298605605959893,
"epoch": 1.627408993576017,
"frac_reward_zero_std": 0.6,
"grad_norm": 0.640625,
"learning_rate": 9.9241e-06,
"loss": -0.0111,
"num_tokens": 86779180.0,
"reward": 0.9118554949760437,
"reward_std": 0.37968810498714445,
"rewards/reward_accuracy/mean": 0.81328125,
"rewards/reward_accuracy/std": 0.3764509975910187,
"rewards/reward_format/mean": 0.09857422113418579,
"rewards/reward_format/std": 0.009390152152627706,
"sampling/importance_sampling_ratio/max": 2.4771934270858766,
"sampling/importance_sampling_ratio/mean": 0.9737643897533417,
"sampling/importance_sampling_ratio/min": 0.07057665693573653,
"sampling/sampling_logp_difference/max": 0.7522788643836975,
"sampling/sampling_logp_difference/mean": 0.006284898752346635,
"step": 760,
"step_time": 9.790596451750025
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.011328125,
"completions/max_length": 1823.2,
"completions/max_terminated_length": 1477.4,
"completions/mean_length": 192.0453125,
"completions/mean_terminated_length": 170.83847198486328,
"completions/min_length": 65.2,
"completions/min_terminated_length": 65.2,
"entropy": 0.11746228802949191,
"epoch": 1.6488222698072805,
"frac_reward_zero_std": 0.64375,
"grad_norm": 0.51171875,
"learning_rate": 9.923100000000002e-06,
"loss": -0.0078,
"num_tokens": 87788336.0,
"reward": 0.9864648878574371,
"reward_std": 0.31246960908174515,
"rewards/reward_accuracy/mean": 0.8875,
"rewards/reward_accuracy/std": 0.3096367135643959,
"rewards/reward_format/mean": 0.0989648461341858,
"rewards/reward_format/std": 0.007414921722374857,
"sampling/importance_sampling_ratio/max": 2.496102452278137,
"sampling/importance_sampling_ratio/mean": 0.988155072927475,
"sampling/importance_sampling_ratio/min": 0.025276933424174787,
"sampling/sampling_logp_difference/max": 0.6404293060302735,
"sampling/sampling_logp_difference/mean": 0.005824843421578407,
"step": 770,
"step_time": 8.47086787414737
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.014453125,
"completions/max_length": 1954.4,
"completions/max_terminated_length": 1742.1,
"completions/mean_length": 225.6328125,
"completions/mean_terminated_length": 199.1234924316406,
"completions/min_length": 72.3,
"completions/min_terminated_length": 72.3,
"entropy": 0.12709145238623024,
"epoch": 1.6702355460385439,
"frac_reward_zero_std": 0.63125,
"grad_norm": 0.5078125,
"learning_rate": 9.922100000000001e-06,
"loss": -0.0156,
"num_tokens": 88886916.0,
"reward": 0.9320117413997651,
"reward_std": 0.36250911056995394,
"rewards/reward_accuracy/mean": 0.833203125,
"rewards/reward_accuracy/std": 0.3601594939827919,
"rewards/reward_format/mean": 0.09880859702825547,
"rewards/reward_format/std": 0.008423830987885595,
"sampling/importance_sampling_ratio/max": 2.511639654636383,
"sampling/importance_sampling_ratio/mean": 0.987099003791809,
"sampling/importance_sampling_ratio/min": 0.07659065537154675,
"sampling/sampling_logp_difference/max": 0.838177764415741,
"sampling/sampling_logp_difference/mean": 0.0061145287938416,
"step": 780,
"step_time": 9.361104059359059
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.2270029376159073e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.2270029376159073e-06,
"completions/clipped_ratio": 0.0296875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1793.3,
"completions/mean_length": 246.694140625,
"completions/mean_terminated_length": 191.7202911376953,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.1404787396080792,
"epoch": 1.6916488222698072,
"frac_reward_zero_std": 0.59375,
"grad_norm": 0.54296875,
"learning_rate": 9.9211e-06,
"loss": -0.0111,
"num_tokens": 90032773.0,
"reward": 0.9436523616313934,
"reward_std": 0.3587296694517136,
"rewards/reward_accuracy/mean": 0.845703125,
"rewards/reward_accuracy/std": 0.3542390584945679,
"rewards/reward_format/mean": 0.09794922024011612,
"rewards/reward_format/std": 0.012350461911410093,
"sampling/importance_sampling_ratio/max": 2.4336459279060363,
"sampling/importance_sampling_ratio/mean": 0.9680092036724091,
"sampling/importance_sampling_ratio/min": 0.017829676531255244,
"sampling/sampling_logp_difference/max": 0.6669148325920105,
"sampling/sampling_logp_difference/mean": 0.006342547759413719,
"step": 790,
"step_time": 10.23502129581757
},
{
"clip_ratio/high_max": 3.493667682050727e-05,
"clip_ratio/high_mean": 4.367084602563409e-06,
"clip_ratio/low_mean": 1.3563470020017121e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 5.723431695514592e-06,
"completions/clipped_ratio": 0.018359375,
"completions/max_length": 1903.6,
"completions/max_terminated_length": 1181.6,
"completions/mean_length": 186.712890625,
"completions/mean_terminated_length": 151.90991897583007,
"completions/min_length": 61.5,
"completions/min_terminated_length": 61.5,
"entropy": 0.11077433116734028,
"epoch": 1.7130620985010707,
"frac_reward_zero_std": 0.70625,
"grad_norm": 0.828125,
"learning_rate": 9.9201e-06,
"loss": -0.0047,
"num_tokens": 91023590.0,
"reward": 0.9818359613418579,
"reward_std": 0.30662353336811066,
"rewards/reward_accuracy/mean": 0.883203125,
"rewards/reward_accuracy/std": 0.3027037002146244,
"rewards/reward_format/mean": 0.09863281399011611,
"rewards/reward_format/std": 0.009655901044607163,
"sampling/importance_sampling_ratio/max": 2.4400421619415282,
"sampling/importance_sampling_ratio/mean": 0.9809924960136414,
"sampling/importance_sampling_ratio/min": 0.15896691009402275,
"sampling/sampling_logp_difference/max": 0.6998325109481811,
"sampling/sampling_logp_difference/mean": 0.0055229177698493,
"step": 800,
"step_time": 9.051756103523076
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 5.18242131875013e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 5.18242131875013e-07,
"completions/clipped_ratio": 0.021484375,
"completions/max_length": 1750.7,
"completions/max_terminated_length": 1456.5,
"completions/mean_length": 195.3734375,
"completions/mean_terminated_length": 154.89309844970703,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.11598751414567232,
"epoch": 1.734475374732334,
"frac_reward_zero_std": 0.75,
"grad_norm": 1.09375,
"learning_rate": 9.9191e-06,
"loss": -0.008,
"num_tokens": 92040898.0,
"reward": 0.9647070646286011,
"reward_std": 0.3352124571800232,
"rewards/reward_accuracy/mean": 0.86640625,
"rewards/reward_accuracy/std": 0.3309496834874153,
"rewards/reward_format/mean": 0.0983007825911045,
"rewards/reward_format/std": 0.009958745469339192,
"sampling/importance_sampling_ratio/max": 2.5101136803627013,
"sampling/importance_sampling_ratio/mean": 0.9888682663440704,
"sampling/importance_sampling_ratio/min": 0.1077797707170248,
"sampling/sampling_logp_difference/max": 0.9090753197669983,
"sampling/sampling_logp_difference/mean": 0.005533263320103288,
"step": 810,
"step_time": 8.98259420269169
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.023046875,
"completions/max_length": 1928.9,
"completions/max_terminated_length": 1784.7,
"completions/mean_length": 231.076953125,
"completions/mean_terminated_length": 188.88939666748047,
"completions/min_length": 67.8,
"completions/min_terminated_length": 67.8,
"entropy": 0.1263550733216107,
"epoch": 1.7558886509635974,
"frac_reward_zero_std": 0.64375,
"grad_norm": 0.5078125,
"learning_rate": 9.9181e-06,
"loss": -0.01,
"num_tokens": 93152215.0,
"reward": 0.9408008038997651,
"reward_std": 0.3481825068593025,
"rewards/reward_accuracy/mean": 0.84296875,
"rewards/reward_accuracy/std": 0.34399643689394,
"rewards/reward_format/mean": 0.09783203229308128,
"rewards/reward_format/std": 0.01143257103394717,
"sampling/importance_sampling_ratio/max": 2.396599221229553,
"sampling/importance_sampling_ratio/mean": 0.974438613653183,
"sampling/importance_sampling_ratio/min": 0.05815908792428672,
"sampling/sampling_logp_difference/max": 0.9249692916870117,
"sampling/sampling_logp_difference/mean": 0.006070325477048754,
"step": 820,
"step_time": 9.202831826731563
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.030859375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1816.8,
"completions/mean_length": 246.005078125,
"completions/mean_terminated_length": 188.80774536132813,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.13789509143680334,
"epoch": 1.777301927194861,
"frac_reward_zero_std": 0.61875,
"grad_norm": 0.74609375,
"learning_rate": 9.9171e-06,
"loss": -0.0058,
"num_tokens": 94299732.0,
"reward": 0.9373632967472076,
"reward_std": 0.36722460985183714,
"rewards/reward_accuracy/mean": 0.839453125,
"rewards/reward_accuracy/std": 0.3627901792526245,
"rewards/reward_format/mean": 0.09791015833616257,
"rewards/reward_format/std": 0.01192841436713934,
"sampling/importance_sampling_ratio/max": 2.4829785346984865,
"sampling/importance_sampling_ratio/mean": 0.9730366170406342,
"sampling/importance_sampling_ratio/min": 0.017973791062831878,
"sampling/sampling_logp_difference/max": 0.9754697799682617,
"sampling/sampling_logp_difference/mean": 0.006479581166058779,
"step": 830,
"step_time": 10.199173214053735
},
{
"clip_ratio/high_max": 2.231140824733302e-05,
"clip_ratio/high_mean": 2.7889260309166276e-06,
"clip_ratio/low_mean": 1.8117643776349723e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.6006904085515995e-06,
"completions/clipped_ratio": 0.05078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1907.2,
"completions/mean_length": 294.341015625,
"completions/mean_terminated_length": 201.25667572021484,
"completions/min_length": 72.0,
"completions/min_terminated_length": 72.0,
"entropy": 0.1741301323287189,
"epoch": 1.7987152034261242,
"frac_reward_zero_std": 0.5875,
"grad_norm": 0.57421875,
"learning_rate": 9.916100000000002e-06,
"loss": -0.0092,
"num_tokens": 95572605.0,
"reward": 0.9119531393051148,
"reward_std": 0.3775117933750153,
"rewards/reward_accuracy/mean": 0.815625,
"rewards/reward_accuracy/std": 0.3704370856285095,
"rewards/reward_format/mean": 0.09632812812924385,
"rewards/reward_format/std": 0.016028174199163914,
"sampling/importance_sampling_ratio/max": 2.683979308605194,
"sampling/importance_sampling_ratio/mean": 0.956336933374405,
"sampling/importance_sampling_ratio/min": 0.004366928152740002,
"sampling/sampling_logp_difference/max": 0.9365596532821655,
"sampling/sampling_logp_difference/mean": 0.00743153365328908,
"step": 840,
"step_time": 10.40536023993045
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.6084392200355069e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.6084392200355069e-06,
"completions/clipped_ratio": 0.034375,
"completions/max_length": 1962.3,
"completions/max_terminated_length": 1642.0,
"completions/mean_length": 258.133984375,
"completions/mean_terminated_length": 195.1166679382324,
"completions/min_length": 61.3,
"completions/min_terminated_length": 61.3,
"entropy": 0.14556633736938238,
"epoch": 1.8201284796573876,
"frac_reward_zero_std": 0.6375,
"grad_norm": 1.0390625,
"learning_rate": 9.915100000000001e-06,
"loss": -0.0108,
"num_tokens": 96753748.0,
"reward": 0.9591406166553498,
"reward_std": 0.3389202758669853,
"rewards/reward_accuracy/mean": 0.862109375,
"rewards/reward_accuracy/std": 0.33241159170866014,
"rewards/reward_format/mean": 0.09703124836087226,
"rewards/reward_format/std": 0.013592235441319645,
"sampling/importance_sampling_ratio/max": 2.4554973006248475,
"sampling/importance_sampling_ratio/mean": 0.965623390674591,
"sampling/importance_sampling_ratio/min": 0.03880217969417572,
"sampling/sampling_logp_difference/max": 0.7726036548614502,
"sampling/sampling_logp_difference/mean": 0.006421024305745959,
"step": 850,
"step_time": 9.846614830428734
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.025390625,
"completions/max_length": 1976.0,
"completions/max_terminated_length": 1732.0,
"completions/mean_length": 243.690234375,
"completions/mean_terminated_length": 196.8784194946289,
"completions/min_length": 68.1,
"completions/min_terminated_length": 68.1,
"entropy": 0.14925894904881715,
"epoch": 1.841541755888651,
"frac_reward_zero_std": 0.5875,
"grad_norm": 0.55859375,
"learning_rate": 9.9141e-06,
"loss": -0.024,
"num_tokens": 97896251.0,
"reward": 0.9528711140155792,
"reward_std": 0.34984823167324064,
"rewards/reward_accuracy/mean": 0.855078125,
"rewards/reward_accuracy/std": 0.34496885240077974,
"rewards/reward_format/mean": 0.09779297038912774,
"rewards/reward_format/std": 0.011865899991244077,
"sampling/importance_sampling_ratio/max": 2.45594242811203,
"sampling/importance_sampling_ratio/mean": 0.9743410110473633,
"sampling/importance_sampling_ratio/min": 0.01487228237092495,
"sampling/sampling_logp_difference/max": 0.7094189167022705,
"sampling/sampling_logp_difference/mean": 0.006630892027169466,
"step": 860,
"step_time": 9.612693790346384
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0421875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1800.7,
"completions/mean_length": 286.90703125,
"completions/mean_terminated_length": 209.81248474121094,
"completions/min_length": 69.7,
"completions/min_terminated_length": 69.7,
"entropy": 0.16136013818904757,
"epoch": 1.8629550321199142,
"frac_reward_zero_std": 0.55625,
"grad_norm": 0.93359375,
"learning_rate": 9.913100000000002e-06,
"loss": -0.0225,
"num_tokens": 99149725.0,
"reward": 0.9054297149181366,
"reward_std": 0.3917454361915588,
"rewards/reward_accuracy/mean": 0.808984375,
"rewards/reward_accuracy/std": 0.3852386325597763,
"rewards/reward_format/mean": 0.09644531384110451,
"rewards/reward_format/std": 0.0163582275621593,
"sampling/importance_sampling_ratio/max": 2.4450995564460754,
"sampling/importance_sampling_ratio/mean": 0.9521192193031311,
"sampling/importance_sampling_ratio/min": 0.02078673876821995,
"sampling/sampling_logp_difference/max": 0.8914358377456665,
"sampling/sampling_logp_difference/mean": 0.006933718826621771,
"step": 870,
"step_time": 10.426300408458337
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.7338515590381575e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.7338515590381575e-06,
"completions/clipped_ratio": 0.030859375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1638.6,
"completions/mean_length": 256.44609375,
"completions/mean_terminated_length": 200.27135467529297,
"completions/min_length": 69.5,
"completions/min_terminated_length": 69.5,
"entropy": 0.151009270362556,
"epoch": 1.8843683083511777,
"frac_reward_zero_std": 0.625,
"grad_norm": 0.34765625,
"learning_rate": 9.912100000000001e-06,
"loss": -0.0136,
"num_tokens": 100320947.0,
"reward": 0.927519553899765,
"reward_std": 0.36917308121919634,
"rewards/reward_accuracy/mean": 0.830078125,
"rewards/reward_accuracy/std": 0.3636032328009605,
"rewards/reward_format/mean": 0.09744140803813935,
"rewards/reward_format/std": 0.014447587542235851,
"sampling/importance_sampling_ratio/max": 2.3376208543777466,
"sampling/importance_sampling_ratio/mean": 0.9511006712913513,
"sampling/importance_sampling_ratio/min": 0.019792939955368637,
"sampling/sampling_logp_difference/max": 0.6955641984939576,
"sampling/sampling_logp_difference/mean": 0.006597352540120482,
"step": 880,
"step_time": 9.911096861446277
},
{
"clip_ratio/high_max": 3.44669126207009e-05,
"clip_ratio/high_mean": 4.308364077587612e-06,
"clip_ratio/low_mean": 1.2744698324240743e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 5.582833910011686e-06,
"completions/clipped_ratio": 0.026171875,
"completions/max_length": 1854.2,
"completions/max_terminated_length": 1515.3,
"completions/mean_length": 233.15078125,
"completions/mean_terminated_length": 185.92127075195313,
"completions/min_length": 69.8,
"completions/min_terminated_length": 69.8,
"entropy": 0.15007403418421744,
"epoch": 1.905781584582441,
"frac_reward_zero_std": 0.65625,
"grad_norm": 0.7265625,
"learning_rate": 9.9111e-06,
"loss": -0.0202,
"num_tokens": 101430933.0,
"reward": 0.948535168170929,
"reward_std": 0.323136767745018,
"rewards/reward_accuracy/mean": 0.850390625,
"rewards/reward_accuracy/std": 0.31987803131341935,
"rewards/reward_format/mean": 0.09814453348517418,
"rewards/reward_format/std": 0.009425759175792336,
"sampling/importance_sampling_ratio/max": 2.3796491861343383,
"sampling/importance_sampling_ratio/mean": 0.9678067207336426,
"sampling/importance_sampling_ratio/min": 0.06145329617138486,
"sampling/sampling_logp_difference/max": 1.082299417257309,
"sampling/sampling_logp_difference/mean": 0.006593769462779164,
"step": 890,
"step_time": 9.031779711786658
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.028515625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1838.8,
"completions/mean_length": 232.096484375,
"completions/mean_terminated_length": 179.09197998046875,
"completions/min_length": 65.6,
"completions/min_terminated_length": 65.6,
"entropy": 0.1435914199799299,
"epoch": 1.9271948608137044,
"frac_reward_zero_std": 0.61875,
"grad_norm": 0.40625,
"learning_rate": 9.9101e-06,
"loss": -0.0178,
"num_tokens": 102547388.0,
"reward": 0.9291601598262786,
"reward_std": 0.37347334921360015,
"rewards/reward_accuracy/mean": 0.83125,
"rewards/reward_accuracy/std": 0.36888945698738096,
"rewards/reward_format/mean": 0.09791015759110451,
"rewards/reward_format/std": 0.012906018923968077,
"sampling/importance_sampling_ratio/max": 2.3964182496070863,
"sampling/importance_sampling_ratio/mean": 0.9703002333641052,
"sampling/importance_sampling_ratio/min": 0.018152867816388606,
"sampling/sampling_logp_difference/max": 0.9208699822425842,
"sampling/sampling_logp_difference/mean": 0.006486426293849945,
"step": 900,
"step_time": 10.148795459978283
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.016796875,
"completions/max_length": 1860.2,
"completions/max_terminated_length": 1676.2,
"completions/mean_length": 203.509375,
"completions/mean_terminated_length": 172.17589721679687,
"completions/min_length": 63.5,
"completions/min_terminated_length": 63.5,
"entropy": 0.13228779640048743,
"epoch": 1.948608137044968,
"frac_reward_zero_std": 0.66875,
"grad_norm": 0.73828125,
"learning_rate": 9.9091e-06,
"loss": -0.0098,
"num_tokens": 103584644.0,
"reward": 0.9349023759365082,
"reward_std": 0.36754566729068755,
"rewards/reward_accuracy/mean": 0.836328125,
"rewards/reward_accuracy/std": 0.3644263416528702,
"rewards/reward_format/mean": 0.09857422038912773,
"rewards/reward_format/std": 0.00941769969649613,
"sampling/importance_sampling_ratio/max": 2.498454213142395,
"sampling/importance_sampling_ratio/mean": 0.9838074266910553,
"sampling/importance_sampling_ratio/min": 0.0364431194961071,
"sampling/sampling_logp_difference/max": 0.6773843705654145,
"sampling/sampling_logp_difference/mean": 0.006243390776216984,
"step": 910,
"step_time": 8.818617072608323
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.868551518986351e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.868551518986351e-07,
"completions/clipped_ratio": 0.018359375,
"completions/max_length": 1851.1,
"completions/max_terminated_length": 1577.8,
"completions/mean_length": 205.1515625,
"completions/mean_terminated_length": 171.00319061279296,
"completions/min_length": 60.5,
"completions/min_terminated_length": 60.5,
"entropy": 0.129123495798558,
"epoch": 1.9700214132762313,
"frac_reward_zero_std": 0.65,
"grad_norm": 0.486328125,
"learning_rate": 9.908100000000001e-06,
"loss": -0.014,
"num_tokens": 104626856.0,
"reward": 0.9649805009365082,
"reward_std": 0.326061787456274,
"rewards/reward_accuracy/mean": 0.866796875,
"rewards/reward_accuracy/std": 0.32202618941664696,
"rewards/reward_format/mean": 0.09818359613418579,
"rewards/reward_format/std": 0.010443945578299463,
"sampling/importance_sampling_ratio/max": 2.1866334557533262,
"sampling/importance_sampling_ratio/mean": 0.9655367493629455,
"sampling/importance_sampling_ratio/min": 0.06379155032336711,
"sampling/sampling_logp_difference/max": 0.8827960252761841,
"sampling/sampling_logp_difference/mean": 0.006098009552806616,
"step": 920,
"step_time": 8.902692521503194
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02578125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1889.4,
"completions/mean_length": 250.184765625,
"completions/mean_terminated_length": 203.3163330078125,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.14765694150701164,
"epoch": 1.9914346895074946,
"frac_reward_zero_std": 0.5875,
"grad_norm": 1.09375,
"learning_rate": 9.9071e-06,
"loss": -0.0173,
"num_tokens": 105791345.0,
"reward": 0.9205664277076722,
"reward_std": 0.37347285747528075,
"rewards/reward_accuracy/mean": 0.823046875,
"rewards/reward_accuracy/std": 0.3688552349805832,
"rewards/reward_format/mean": 0.0975195325911045,
"rewards/reward_format/std": 0.013043741649016737,
"sampling/importance_sampling_ratio/max": 2.4623132228851317,
"sampling/importance_sampling_ratio/mean": 0.9742694735527039,
"sampling/importance_sampling_ratio/min": 0.107972346059978,
"sampling/sampling_logp_difference/max": 0.6812215805053711,
"sampling/sampling_logp_difference/mean": 0.006520324340090156,
"step": 930,
"step_time": 10.203394064679742
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012890625,
"completions/max_length": 1993.4,
"completions/max_terminated_length": 1662.2,
"completions/mean_length": 197.094921875,
"completions/mean_terminated_length": 173.0997344970703,
"completions/min_length": 62.6,
"completions/min_terminated_length": 62.6,
"entropy": 0.12167932614684104,
"epoch": 2.012847965738758,
"frac_reward_zero_std": 0.70625,
"grad_norm": 0.408203125,
"learning_rate": 9.9061e-06,
"loss": -0.0189,
"num_tokens": 106803268.0,
"reward": 0.9904492378234864,
"reward_std": 0.29305783063173296,
"rewards/reward_accuracy/mean": 0.891796875,
"rewards/reward_accuracy/std": 0.2895434215664864,
"rewards/reward_format/mean": 0.09865234419703484,
"rewards/reward_format/std": 0.009380003018304706,
"sampling/importance_sampling_ratio/max": 2.3492308497428893,
"sampling/importance_sampling_ratio/mean": 0.9921432733535767,
"sampling/importance_sampling_ratio/min": 0.0743491357192397,
"sampling/sampling_logp_difference/max": 0.9991929113864899,
"sampling/sampling_logp_difference/mean": 0.005784861464053393,
"step": 940,
"step_time": 9.489736239984632
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1682.0,
"completions/max_terminated_length": 1589.9,
"completions/mean_length": 199.523046875,
"completions/mean_terminated_length": 183.84711608886718,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.11632204605266452,
"epoch": 2.0342612419700212,
"frac_reward_zero_std": 0.70625,
"grad_norm": 0.859375,
"learning_rate": 9.905100000000001e-06,
"loss": -0.0078,
"num_tokens": 107834575.0,
"reward": 0.9671094059944153,
"reward_std": 0.3248412474989891,
"rewards/reward_accuracy/mean": 0.86796875,
"rewards/reward_accuracy/std": 0.3228647321462631,
"rewards/reward_format/mean": 0.09914062693715095,
"rewards/reward_format/std": 0.0064982657320797445,
"sampling/importance_sampling_ratio/max": 2.41606582403183,
"sampling/importance_sampling_ratio/mean": 0.9726782619953156,
"sampling/importance_sampling_ratio/min": 0.04130089245736599,
"sampling/sampling_logp_difference/max": 0.7168623566627502,
"sampling/sampling_logp_difference/mean": 0.005662383325397968,
"step": 950,
"step_time": 8.030469681881367
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015234375,
"completions/max_length": 1971.9,
"completions/max_terminated_length": 1759.7,
"completions/mean_length": 224.001171875,
"completions/mean_terminated_length": 195.8615463256836,
"completions/min_length": 62.7,
"completions/min_terminated_length": 62.7,
"entropy": 0.12755659418180584,
"epoch": 2.0556745182012848,
"frac_reward_zero_std": 0.7,
"grad_norm": 0.5859375,
"learning_rate": 9.9041e-06,
"loss": -0.0091,
"num_tokens": 108926034.0,
"reward": 0.9459765791893006,
"reward_std": 0.34271051585674284,
"rewards/reward_accuracy/mean": 0.847265625,
"rewards/reward_accuracy/std": 0.33992874771356585,
"rewards/reward_format/mean": 0.0987109400331974,
"rewards/reward_format/std": 0.008912423229776322,
"sampling/importance_sampling_ratio/max": 2.5717740774154665,
"sampling/importance_sampling_ratio/mean": 0.9788214683532714,
"sampling/importance_sampling_ratio/min": 0.05705595798790455,
"sampling/sampling_logp_difference/max": 0.7393279790878295,
"sampling/sampling_logp_difference/mean": 0.006034904532134533,
"step": 960,
"step_time": 9.32920954786241
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01484375,
"completions/max_length": 1711.1,
"completions/max_terminated_length": 1395.8,
"completions/mean_length": 209.419921875,
"completions/mean_terminated_length": 182.30191955566406,
"completions/min_length": 60.4,
"completions/min_terminated_length": 60.4,
"entropy": 0.12380664227530361,
"epoch": 2.0770877944325483,
"frac_reward_zero_std": 0.65,
"grad_norm": 0.31640625,
"learning_rate": 9.903100000000002e-06,
"loss": -0.0117,
"num_tokens": 109982725.0,
"reward": 0.9878125309944152,
"reward_std": 0.3071736603975296,
"rewards/reward_accuracy/mean": 0.8890625,
"rewards/reward_accuracy/std": 0.30443327128887177,
"rewards/reward_format/mean": 0.0987500011920929,
"rewards/reward_format/std": 0.007103267405182123,
"sampling/importance_sampling_ratio/max": 2.5186639428138733,
"sampling/importance_sampling_ratio/mean": 0.9927192151546478,
"sampling/importance_sampling_ratio/min": 0.1291866797953844,
"sampling/sampling_logp_difference/max": 0.7177225947380066,
"sampling/sampling_logp_difference/mean": 0.006064361007884145,
"step": 970,
"step_time": 8.192460826179012
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.011328125,
"completions/max_length": 1888.2,
"completions/max_terminated_length": 1716.0,
"completions/mean_length": 220.114453125,
"completions/mean_terminated_length": 199.4204528808594,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.1248143456876278,
"epoch": 2.0985010706638114,
"frac_reward_zero_std": 0.73125,
"grad_norm": 0.92578125,
"learning_rate": 9.902100000000001e-06,
"loss": -0.0103,
"num_tokens": 111063114.0,
"reward": 0.9481836080551147,
"reward_std": 0.34800865799188613,
"rewards/reward_accuracy/mean": 0.84921875,
"rewards/reward_accuracy/std": 0.3457888960838318,
"rewards/reward_format/mean": 0.0989648461341858,
"rewards/reward_format/std": 0.007306190836243331,
"sampling/importance_sampling_ratio/max": 2.4548211336135863,
"sampling/importance_sampling_ratio/mean": 0.9745739519596099,
"sampling/importance_sampling_ratio/min": 0.050421778485178946,
"sampling/sampling_logp_difference/max": 0.7700303494930267,
"sampling/sampling_logp_difference/mean": 0.0058918816968798636,
"step": 980,
"step_time": 9.191250279778615
},
{
"clip_ratio/high_max": 2.1219213886070064e-05,
"clip_ratio/high_mean": 2.652401735758758e-06,
"clip_ratio/low_mean": 2.7698527446773367e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 5.422254480436095e-06,
"completions/clipped_ratio": 0.02578125,
"completions/max_length": 1936.6,
"completions/max_terminated_length": 1634.9,
"completions/mean_length": 253.598046875,
"completions/mean_terminated_length": 206.3838119506836,
"completions/min_length": 60.8,
"completions/min_terminated_length": 60.8,
"entropy": 0.1312790905125439,
"epoch": 2.119914346895075,
"frac_reward_zero_std": 0.6,
"grad_norm": 0.53125,
"learning_rate": 9.9011e-06,
"loss": -0.0153,
"num_tokens": 112230869.0,
"reward": 0.9458007872104645,
"reward_std": 0.3503704905509949,
"rewards/reward_accuracy/mean": 0.848046875,
"rewards/reward_accuracy/std": 0.3457596808671951,
"rewards/reward_format/mean": 0.09775390774011612,
"rewards/reward_format/std": 0.011316603142768144,
"sampling/importance_sampling_ratio/max": 2.300599145889282,
"sampling/importance_sampling_ratio/mean": 0.962765496969223,
"sampling/importance_sampling_ratio/min": 0.04408282991498709,
"sampling/sampling_logp_difference/max": 0.9864498734474182,
"sampling/sampling_logp_difference/mean": 0.006157218152657152,
"step": 990,
"step_time": 9.784059684118256
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01484375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1761.1,
"completions/mean_length": 221.127734375,
"completions/mean_terminated_length": 193.78389434814454,
"completions/min_length": 70.2,
"completions/min_terminated_length": 70.2,
"entropy": 0.12627201676368713,
"epoch": 2.1413276231263385,
"frac_reward_zero_std": 0.6375,
"grad_norm": 0.37890625,
"learning_rate": 9.9001e-06,
"loss": -0.0207,
"num_tokens": 113315228.0,
"reward": 0.9744140863418579,
"reward_std": 0.32944023609161377,
"rewards/reward_accuracy/mean": 0.87578125,
"rewards/reward_accuracy/std": 0.32610152661800385,
"rewards/reward_format/mean": 0.09863281399011611,
"rewards/reward_format/std": 0.009054604661650955,
"sampling/importance_sampling_ratio/max": 2.513620209693909,
"sampling/importance_sampling_ratio/mean": 0.9820565819740296,
"sampling/importance_sampling_ratio/min": 0.032299659587442874,
"sampling/sampling_logp_difference/max": 0.8166385769844056,
"sampling/sampling_logp_difference/mean": 0.00624980260618031,
"step": 1000,
"step_time": 9.662331256689503
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.017578125,
"completions/max_length": 1986.5,
"completions/max_terminated_length": 1775.3,
"completions/mean_length": 237.170703125,
"completions/mean_terminated_length": 205.26653900146485,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.1205636235885322,
"epoch": 2.1627408993576016,
"frac_reward_zero_std": 0.65625,
"grad_norm": 0.5,
"learning_rate": 9.8991e-06,
"loss": -0.0148,
"num_tokens": 114443953.0,
"reward": 0.9759961128234863,
"reward_std": 0.30793729424476624,
"rewards/reward_accuracy/mean": 0.877734375,
"rewards/reward_accuracy/std": 0.3037992350757122,
"rewards/reward_format/mean": 0.09826171919703483,
"rewards/reward_format/std": 0.010592820821329951,
"sampling/importance_sampling_ratio/max": 2.507185387611389,
"sampling/importance_sampling_ratio/mean": 0.9686585545539856,
"sampling/importance_sampling_ratio/min": 0.04109625471755862,
"sampling/sampling_logp_difference/max": 0.8997818410396576,
"sampling/sampling_logp_difference/mean": 0.005891357082873583,
"step": 1010,
"step_time": 9.4522584927734
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.014453125,
"completions/max_length": 1830.3,
"completions/max_terminated_length": 1615.2,
"completions/mean_length": 224.009375,
"completions/mean_terminated_length": 197.65143432617188,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"entropy": 0.12155499421060086,
"epoch": 2.184154175588865,
"frac_reward_zero_std": 0.66875,
"grad_norm": 0.71875,
"learning_rate": 9.898100000000001e-06,
"loss": -0.0177,
"num_tokens": 115532937.0,
"reward": 0.9747656464576722,
"reward_std": 0.30199117213487625,
"rewards/reward_accuracy/mean": 0.876171875,
"rewards/reward_accuracy/std": 0.299282605946064,
"rewards/reward_format/mean": 0.09859374910593033,
"rewards/reward_format/std": 0.00904646348208189,
"sampling/importance_sampling_ratio/max": 2.4035712122917174,
"sampling/importance_sampling_ratio/mean": 0.9765183568000794,
"sampling/importance_sampling_ratio/min": 0.060005871951580046,
"sampling/sampling_logp_difference/max": 0.8479045391082763,
"sampling/sampling_logp_difference/mean": 0.005943241342902183,
"step": 1020,
"step_time": 8.956811558129266
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.023046875,
"completions/max_length": 1993.6,
"completions/max_terminated_length": 1647.4,
"completions/mean_length": 239.5546875,
"completions/mean_terminated_length": 197.78245544433594,
"completions/min_length": 66.4,
"completions/min_terminated_length": 66.4,
"entropy": 0.13255306417122484,
"epoch": 2.2055674518201283,
"frac_reward_zero_std": 0.61875,
"grad_norm": 0.7421875,
"learning_rate": 9.8971e-06,
"loss": -0.0204,
"num_tokens": 116655029.0,
"reward": 0.9399414241313935,
"reward_std": 0.34093261063098906,
"rewards/reward_accuracy/mean": 0.841796875,
"rewards/reward_accuracy/std": 0.3370689421892166,
"rewards/reward_format/mean": 0.09814453274011611,
"rewards/reward_format/std": 0.011449454771354794,
"sampling/importance_sampling_ratio/max": 2.486461675167084,
"sampling/importance_sampling_ratio/mean": 0.9700662016868591,
"sampling/importance_sampling_ratio/min": 0.009044223325327038,
"sampling/sampling_logp_difference/max": 0.6451917290687561,
"sampling/sampling_logp_difference/mean": 0.006465697987005114,
"step": 1030,
"step_time": 9.519106068648398
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01484375,
"completions/max_length": 1966.5,
"completions/max_terminated_length": 1707.3,
"completions/mean_length": 218.703515625,
"completions/mean_terminated_length": 191.1827865600586,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"entropy": 0.12091882657259703,
"epoch": 2.226980728051392,
"frac_reward_zero_std": 0.675,
"grad_norm": 0.59765625,
"learning_rate": 9.8961e-06,
"loss": -0.0173,
"num_tokens": 117730798.0,
"reward": 0.9847265899181366,
"reward_std": 0.3154772475361824,
"rewards/reward_accuracy/mean": 0.8859375,
"rewards/reward_accuracy/std": 0.31200191378593445,
"rewards/reward_format/mean": 0.09878906458616257,
"rewards/reward_format/std": 0.009305128315463661,
"sampling/importance_sampling_ratio/max": 2.4802735924720762,
"sampling/importance_sampling_ratio/mean": 0.9671303331851959,
"sampling/importance_sampling_ratio/min": 0.04748152866959572,
"sampling/sampling_logp_difference/max": 0.6354176998138428,
"sampling/sampling_logp_difference/mean": 0.006041896250098944,
"step": 1040,
"step_time": 9.153514892002567
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.7045945696736454e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.7045945696736454e-06,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 1896.9,
"completions/max_terminated_length": 1664.1,
"completions/mean_length": 238.534375,
"completions/mean_terminated_length": 210.68414916992188,
"completions/min_length": 67.9,
"completions/min_terminated_length": 67.9,
"entropy": 0.12248198008164764,
"epoch": 2.2483940042826553,
"frac_reward_zero_std": 0.625,
"grad_norm": 0.84765625,
"learning_rate": 9.895100000000001e-06,
"loss": -0.0047,
"num_tokens": 118855702.0,
"reward": 0.9943359673023224,
"reward_std": 0.3012785717844963,
"rewards/reward_accuracy/mean": 0.89609375,
"rewards/reward_accuracy/std": 0.2975010871887207,
"rewards/reward_format/mean": 0.09824219048023224,
"rewards/reward_format/std": 0.009342654282227159,
"sampling/importance_sampling_ratio/max": 2.6094794988632204,
"sampling/importance_sampling_ratio/mean": 0.9811691761016845,
"sampling/importance_sampling_ratio/min": 0.07318041063845157,
"sampling/sampling_logp_difference/max": 0.7872648358345031,
"sampling/sampling_logp_difference/mean": 0.005984523566439748,
"step": 1050,
"step_time": 8.997180890105664
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.8131776161899325e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.8131776161899325e-06,
"completions/clipped_ratio": 0.040234375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1895.9,
"completions/mean_length": 309.9234375,
"completions/mean_terminated_length": 237.65003204345703,
"completions/min_length": 72.6,
"completions/min_terminated_length": 72.6,
"entropy": 0.147100061038509,
"epoch": 2.2698072805139184,
"frac_reward_zero_std": 0.63125,
"grad_norm": 1.140625,
"learning_rate": 9.8941e-06,
"loss": -0.0183,
"num_tokens": 120169138.0,
"reward": 0.9496679961681366,
"reward_std": 0.3516485095024109,
"rewards/reward_accuracy/mean": 0.853125,
"rewards/reward_accuracy/std": 0.34416040033102036,
"rewards/reward_format/mean": 0.09654297083616256,
"rewards/reward_format/std": 0.015939757600426673,
"sampling/importance_sampling_ratio/max": 2.608386516571045,
"sampling/importance_sampling_ratio/mean": 0.9462941825389862,
"sampling/importance_sampling_ratio/min": 0.021119034476578237,
"sampling/sampling_logp_difference/max": 0.7626579344272614,
"sampling/sampling_logp_difference/mean": 0.00669051269069314,
"step": 1060,
"step_time": 10.324304767046124
},
{
"clip_ratio/high_max": 8.411843737121671e-06,
"clip_ratio/high_mean": 1.051480467140209e-06,
"clip_ratio/low_mean": 6.567557079506514e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 7.619037569384091e-06,
"completions/clipped_ratio": 0.031640625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1892.6,
"completions/mean_length": 280.773828125,
"completions/mean_terminated_length": 223.28890075683594,
"completions/min_length": 65.7,
"completions/min_terminated_length": 65.7,
"entropy": 0.14687624899670482,
"epoch": 2.291220556745182,
"frac_reward_zero_std": 0.66875,
"grad_norm": 0.4609375,
"learning_rate": 9.8931e-06,
"loss": -0.0103,
"num_tokens": 121402559.0,
"reward": 0.9601758182048797,
"reward_std": 0.3412570759654045,
"rewards/reward_accuracy/mean": 0.86328125,
"rewards/reward_accuracy/std": 0.3343312531709671,
"rewards/reward_format/mean": 0.09689453393220901,
"rewards/reward_format/std": 0.015267401188611984,
"sampling/importance_sampling_ratio/max": 2.4585010766983033,
"sampling/importance_sampling_ratio/mean": 0.9576635420322418,
"sampling/importance_sampling_ratio/min": 0.025234085321426392,
"sampling/sampling_logp_difference/max": 0.8232152819633484,
"sampling/sampling_logp_difference/mean": 0.006720620673149824,
"step": 1070,
"step_time": 10.166967736696824
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.026953125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1824.5,
"completions/mean_length": 263.104296875,
"completions/mean_terminated_length": 214.14144134521484,
"completions/min_length": 74.1,
"completions/min_terminated_length": 74.1,
"entropy": 0.13370681600645185,
"epoch": 2.3126338329764455,
"frac_reward_zero_std": 0.65,
"grad_norm": 1.234375,
"learning_rate": 9.892100000000001e-06,
"loss": -0.0157,
"num_tokens": 122595466.0,
"reward": 0.9378320634365082,
"reward_std": 0.3525817796587944,
"rewards/reward_accuracy/mean": 0.840234375,
"rewards/reward_accuracy/std": 0.3474182948470116,
"rewards/reward_format/mean": 0.09759765714406968,
"rewards/reward_format/std": 0.013238419266417622,
"sampling/importance_sampling_ratio/max": 2.680613565444946,
"sampling/importance_sampling_ratio/mean": 0.9599035441875458,
"sampling/importance_sampling_ratio/min": 0.029577143862843512,
"sampling/sampling_logp_difference/max": 0.8147324562072754,
"sampling/sampling_logp_difference/mean": 0.006415283959358931,
"step": 1080,
"step_time": 9.683272144477815
},
{
"clip_ratio/high_max": 1.0416666918899864e-05,
"clip_ratio/high_mean": 1.302083364862483e-06,
"clip_ratio/low_mean": 1.595896742401237e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.8979801072637203e-06,
"completions/clipped_ratio": 0.022265625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1804.3,
"completions/mean_length": 244.9875,
"completions/mean_terminated_length": 203.84751739501954,
"completions/min_length": 71.5,
"completions/min_terminated_length": 71.5,
"entropy": 0.12266029668971896,
"epoch": 2.3340471092077086,
"frac_reward_zero_std": 0.71875,
"grad_norm": 0.2294921875,
"learning_rate": 9.891100000000001e-06,
"loss": -0.0107,
"num_tokens": 123737722.0,
"reward": 1.0016602158546448,
"reward_std": 0.293124695122242,
"rewards/reward_accuracy/mean": 0.903515625,
"rewards/reward_accuracy/std": 0.288481830060482,
"rewards/reward_format/mean": 0.09814453274011611,
"rewards/reward_format/std": 0.011180605180561543,
"sampling/importance_sampling_ratio/max": 2.513754057884216,
"sampling/importance_sampling_ratio/mean": 0.9695345818996429,
"sampling/importance_sampling_ratio/min": 0.029576815478503705,
"sampling/sampling_logp_difference/max": 0.8481000185012817,
"sampling/sampling_logp_difference/mean": 0.005876340437680483,
"step": 1090,
"step_time": 10.117800503969193
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.036328125,
"completions/max_length": 1951.3,
"completions/max_terminated_length": 1771.1,
"completions/mean_length": 262.37109375,
"completions/mean_terminated_length": 195.63728790283204,
"completions/min_length": 76.1,
"completions/min_terminated_length": 76.1,
"entropy": 0.12640515374951064,
"epoch": 2.355460385438972,
"frac_reward_zero_std": 0.625,
"grad_norm": 0.69921875,
"learning_rate": 9.8901e-06,
"loss": -0.0252,
"num_tokens": 124921152.0,
"reward": 0.9613086163997651,
"reward_std": 0.3352919176220894,
"rewards/reward_accuracy/mean": 0.864453125,
"rewards/reward_accuracy/std": 0.3288334637880325,
"rewards/reward_format/mean": 0.09685546979308128,
"rewards/reward_format/std": 0.01449173039291054,
"sampling/importance_sampling_ratio/max": 2.570423650741577,
"sampling/importance_sampling_ratio/mean": 0.9678205013275146,
"sampling/importance_sampling_ratio/min": 0.03777830898761749,
"sampling/sampling_logp_difference/max": 0.6866097390651703,
"sampling/sampling_logp_difference/mean": 0.00607558167539537,
"step": 1100,
"step_time": 9.510219195391983
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.3601236989634346e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.3601236989634346e-06,
"completions/clipped_ratio": 0.032421875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1929.7,
"completions/mean_length": 285.721875,
"completions/mean_terminated_length": 227.0260208129883,
"completions/min_length": 76.2,
"completions/min_terminated_length": 76.2,
"entropy": 0.13211327306926252,
"epoch": 2.3768736616702357,
"frac_reward_zero_std": 0.66875,
"grad_norm": 0.5390625,
"learning_rate": 9.8891e-06,
"loss": -0.0186,
"num_tokens": 126172536.0,
"reward": 0.9609179854393005,
"reward_std": 0.3383749857544899,
"rewards/reward_accuracy/mean": 0.863671875,
"rewards/reward_accuracy/std": 0.3321027413010597,
"rewards/reward_format/mean": 0.09724609404802323,
"rewards/reward_format/std": 0.014321976550854742,
"sampling/importance_sampling_ratio/max": 2.5327759265899656,
"sampling/importance_sampling_ratio/mean": 0.9528759002685547,
"sampling/importance_sampling_ratio/min": 0.03754093796014786,
"sampling/sampling_logp_difference/max": 0.7833775043487549,
"sampling/sampling_logp_difference/mean": 0.006160255568102002,
"step": 1110,
"step_time": 10.354878402687609
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.43038587339106e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.43038587339106e-06,
"completions/clipped_ratio": 0.03046875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1730.9,
"completions/mean_length": 266.85546875,
"completions/mean_terminated_length": 211.3396194458008,
"completions/min_length": 72.3,
"completions/min_terminated_length": 72.3,
"entropy": 0.12343061584979295,
"epoch": 2.398286937901499,
"frac_reward_zero_std": 0.7,
"grad_norm": 0.66796875,
"learning_rate": 9.888100000000001e-06,
"loss": -0.0103,
"num_tokens": 127377334.0,
"reward": 0.9668164134025574,
"reward_std": 0.33379283994436265,
"rewards/reward_accuracy/mean": 0.86953125,
"rewards/reward_accuracy/std": 0.32742525190114974,
"rewards/reward_format/mean": 0.09728515595197677,
"rewards/reward_format/std": 0.014404558949172497,
"sampling/importance_sampling_ratio/max": 2.419392716884613,
"sampling/importance_sampling_ratio/mean": 0.9670025050640106,
"sampling/importance_sampling_ratio/min": 0.05642097443342209,
"sampling/sampling_logp_difference/max": 0.8164916872978211,
"sampling/sampling_logp_difference/mean": 0.0059681158978492025,
"step": 1120,
"step_time": 10.269993857340888
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 9.061368700713502e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 9.061368700713502e-07,
"completions/clipped_ratio": 0.021484375,
"completions/max_length": 1921.2,
"completions/max_terminated_length": 1659.0,
"completions/mean_length": 235.24921875,
"completions/mean_terminated_length": 195.7997802734375,
"completions/min_length": 77.2,
"completions/min_terminated_length": 77.2,
"entropy": 0.11750046471133828,
"epoch": 2.4197002141327624,
"frac_reward_zero_std": 0.6875,
"grad_norm": 0.7109375,
"learning_rate": 9.8871e-06,
"loss": -0.0163,
"num_tokens": 128503588.0,
"reward": 0.9483398616313934,
"reward_std": 0.35108003169298174,
"rewards/reward_accuracy/mean": 0.85,
"rewards/reward_accuracy/std": 0.3469109281897545,
"rewards/reward_format/mean": 0.09833984375,
"rewards/reward_format/std": 0.010394430113956332,
"sampling/importance_sampling_ratio/max": 2.410228097438812,
"sampling/importance_sampling_ratio/mean": 0.9705608308315277,
"sampling/importance_sampling_ratio/min": 0.012885813042521477,
"sampling/sampling_logp_difference/max": 0.7898650825023651,
"sampling/sampling_logp_difference/mean": 0.0060071276500821115,
"step": 1130,
"step_time": 9.265017144754529
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.086288734266418e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.086288734266418e-06,
"completions/clipped_ratio": 0.01640625,
"completions/max_length": 1779.6,
"completions/max_terminated_length": 1499.9,
"completions/mean_length": 208.53046875,
"completions/mean_terminated_length": 178.2081283569336,
"completions/min_length": 71.4,
"completions/min_terminated_length": 71.4,
"entropy": 0.09634291706606746,
"epoch": 2.4411134903640255,
"frac_reward_zero_std": 0.7,
"grad_norm": 0.515625,
"learning_rate": 9.8861e-06,
"loss": -0.0195,
"num_tokens": 129554674.0,
"reward": 0.9709179818630218,
"reward_std": 0.30105303823947904,
"rewards/reward_accuracy/mean": 0.872265625,
"rewards/reward_accuracy/std": 0.29809298515319826,
"rewards/reward_format/mean": 0.09865234568715095,
"rewards/reward_format/std": 0.007906114892102778,
"sampling/importance_sampling_ratio/max": 2.6309684038162233,
"sampling/importance_sampling_ratio/mean": 0.9861074686050415,
"sampling/importance_sampling_ratio/min": 0.09028481394052505,
"sampling/sampling_logp_difference/max": 0.8634990096092224,
"sampling/sampling_logp_difference/mean": 0.005428957473486662,
"step": 1140,
"step_time": 8.799830540595575
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 1726.8,
"completions/max_terminated_length": 1590.4,
"completions/mean_length": 216.330078125,
"completions/mean_terminated_length": 187.59940032958986,
"completions/min_length": 71.2,
"completions/min_terminated_length": 71.2,
"entropy": 0.10101239359937608,
"epoch": 2.462526766595289,
"frac_reward_zero_std": 0.725,
"grad_norm": 0.388671875,
"learning_rate": 9.885100000000001e-06,
"loss": -0.0144,
"num_tokens": 130624511.0,
"reward": 0.9794922113418579,
"reward_std": 0.28809296593535694,
"rewards/reward_accuracy/mean": 0.880859375,
"rewards/reward_accuracy/std": 0.28479473367333413,
"rewards/reward_format/mean": 0.0986328125,
"rewards/reward_format/std": 0.008401826815679669,
"sampling/importance_sampling_ratio/max": 2.5038231372833253,
"sampling/importance_sampling_ratio/mean": 0.9761457800865173,
"sampling/importance_sampling_ratio/min": 0.11141059398651124,
"sampling/sampling_logp_difference/max": 0.7283841013908386,
"sampling/sampling_logp_difference/mean": 0.005474243592470884,
"step": 1150,
"step_time": 8.53159620151855
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 4.5992108425707555e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.5992108425707555e-06,
"completions/clipped_ratio": 0.026953125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1696.6,
"completions/mean_length": 265.127734375,
"completions/mean_terminated_length": 216.07809295654297,
"completions/min_length": 70.1,
"completions/min_terminated_length": 70.1,
"entropy": 0.11614525141194462,
"epoch": 2.4839400428265526,
"frac_reward_zero_std": 0.61875,
"grad_norm": 0.8203125,
"learning_rate": 9.8841e-06,
"loss": -0.017,
"num_tokens": 131825734.0,
"reward": 0.939746105670929,
"reward_std": 0.3664032369852066,
"rewards/reward_accuracy/mean": 0.8421875,
"rewards/reward_accuracy/std": 0.3609219193458557,
"rewards/reward_format/mean": 0.09755859449505806,
"rewards/reward_format/std": 0.013077843934297562,
"sampling/importance_sampling_ratio/max": 2.4015148401260378,
"sampling/importance_sampling_ratio/mean": 0.9731174051761627,
"sampling/importance_sampling_ratio/min": 0.026527552306652068,
"sampling/sampling_logp_difference/max": 0.8383093237876892,
"sampling/sampling_logp_difference/mean": 0.0058770699892193076,
"step": 1160,
"step_time": 9.936668931273744
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01875,
"completions/max_length": 1903.7,
"completions/max_terminated_length": 1725.8,
"completions/mean_length": 246.346875,
"completions/mean_terminated_length": 212.08897552490234,
"completions/min_length": 79.8,
"completions/min_terminated_length": 79.8,
"entropy": 0.11083816634491087,
"epoch": 2.505353319057816,
"frac_reward_zero_std": 0.6875,
"grad_norm": 0.72265625,
"learning_rate": 9.8831e-06,
"loss": -0.0114,
"num_tokens": 132973358.0,
"reward": 0.9773437857627869,
"reward_std": 0.31524987146258354,
"rewards/reward_accuracy/mean": 0.87890625,
"rewards/reward_accuracy/std": 0.31120840832591057,
"rewards/reward_format/mean": 0.09843750149011612,
"rewards/reward_format/std": 0.009796102903783322,
"sampling/importance_sampling_ratio/max": 2.38149436712265,
"sampling/importance_sampling_ratio/mean": 0.968826287984848,
"sampling/importance_sampling_ratio/min": 0.013686629431322216,
"sampling/sampling_logp_difference/max": 0.7478554666042327,
"sampling/sampling_logp_difference/mean": 0.005905471835285425,
"step": 1170,
"step_time": 9.177805413864553
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012109375,
"completions/max_length": 1970.6,
"completions/max_terminated_length": 1723.4,
"completions/mean_length": 224.276953125,
"completions/mean_terminated_length": 202.0638641357422,
"completions/min_length": 76.2,
"completions/min_terminated_length": 76.2,
"entropy": 0.11099376552738249,
"epoch": 2.526766595289079,
"frac_reward_zero_std": 0.70625,
"grad_norm": 0.74609375,
"learning_rate": 9.882100000000001e-06,
"loss": -0.0047,
"num_tokens": 134062915.0,
"reward": 0.9767382860183715,
"reward_std": 0.32685485780239104,
"rewards/reward_accuracy/mean": 0.877734375,
"rewards/reward_accuracy/std": 0.3242702782154083,
"rewards/reward_format/mean": 0.09900390654802323,
"rewards/reward_format/std": 0.007977549475617707,
"sampling/importance_sampling_ratio/max": 2.5268240451812742,
"sampling/importance_sampling_ratio/mean": 0.9754394590854645,
"sampling/importance_sampling_ratio/min": 0.02971261367201805,
"sampling/sampling_logp_difference/max": 0.6882762312889099,
"sampling/sampling_logp_difference/mean": 0.005719746043905616,
"step": 1180,
"step_time": 9.392645579902455
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.5509234521668986e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.5509234521668986e-06,
"completions/clipped_ratio": 0.026953125,
"completions/max_length": 1982.0,
"completions/max_terminated_length": 1707.0,
"completions/mean_length": 278.45,
"completions/mean_terminated_length": 230.33758239746095,
"completions/min_length": 75.3,
"completions/min_terminated_length": 75.3,
"entropy": 0.12821501782163977,
"epoch": 2.5481798715203428,
"frac_reward_zero_std": 0.63125,
"grad_norm": 0.46484375,
"learning_rate": 9.881100000000001e-06,
"loss": -0.0179,
"num_tokens": 135300035.0,
"reward": 0.9256445527076721,
"reward_std": 0.3503075659275055,
"rewards/reward_accuracy/mean": 0.827734375,
"rewards/reward_accuracy/std": 0.3460334658622742,
"rewards/reward_format/mean": 0.09791015684604645,
"rewards/reward_format/std": 0.012611499638296664,
"sampling/importance_sampling_ratio/max": 2.673357939720154,
"sampling/importance_sampling_ratio/mean": 0.9690265715122223,
"sampling/importance_sampling_ratio/min": 0.0332604312337935,
"sampling/sampling_logp_difference/max": 1.2096776962280273,
"sampling/sampling_logp_difference/mean": 0.006227149907499552,
"step": 1190,
"step_time": 9.643906076671556
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.329770879645366e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.329770879645366e-06,
"completions/clipped_ratio": 0.026171875,
"completions/max_length": 1929.4,
"completions/max_terminated_length": 1724.5,
"completions/mean_length": 255.20390625,
"completions/mean_terminated_length": 207.6074966430664,
"completions/min_length": 77.8,
"completions/min_terminated_length": 77.8,
"entropy": 0.12322955592535437,
"epoch": 2.569593147751606,
"frac_reward_zero_std": 0.6375,
"grad_norm": 0.45703125,
"learning_rate": 9.880100000000002e-06,
"loss": -0.0224,
"num_tokens": 136471693.0,
"reward": 0.9662891030311584,
"reward_std": 0.32554339319467546,
"rewards/reward_accuracy/mean": 0.86875,
"rewards/reward_accuracy/std": 0.31977187395095824,
"rewards/reward_format/mean": 0.09753906354308128,
"rewards/reward_format/std": 0.01225655348971486,
"sampling/importance_sampling_ratio/max": 2.5436065673828123,
"sampling/importance_sampling_ratio/mean": 0.976447606086731,
"sampling/importance_sampling_ratio/min": 0.053687041997909545,
"sampling/sampling_logp_difference/max": 1.4991020500659942,
"sampling/sampling_logp_difference/mean": 0.006122301518917084,
"step": 1200,
"step_time": 9.446402003895491
},
{
"clip_ratio/high_max": 4.926416295347735e-06,
"clip_ratio/high_mean": 6.158020369184669e-07,
"clip_ratio/low_mean": 2.9090949055898816e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.5248969425083486e-06,
"completions/clipped_ratio": 0.012890625,
"completions/max_length": 1958.5,
"completions/max_terminated_length": 1712.1,
"completions/mean_length": 237.2234375,
"completions/mean_terminated_length": 213.35184020996093,
"completions/min_length": 81.0,
"completions/min_terminated_length": 81.0,
"entropy": 0.10248684603720903,
"epoch": 2.5910064239828694,
"frac_reward_zero_std": 0.74375,
"grad_norm": 1.40625,
"learning_rate": 9.8791e-06,
"loss": -0.0005,
"num_tokens": 137597017.0,
"reward": 0.9930664122104644,
"reward_std": 0.2985305577516556,
"rewards/reward_accuracy/mean": 0.894140625,
"rewards/reward_accuracy/std": 0.2958211272954941,
"rewards/reward_format/mean": 0.09892578199505805,
"rewards/reward_format/std": 0.00706928342115134,
"sampling/importance_sampling_ratio/max": 2.606118392944336,
"sampling/importance_sampling_ratio/mean": 0.9743223965168,
"sampling/importance_sampling_ratio/min": 0.037309590727090836,
"sampling/sampling_logp_difference/max": 0.6893625378608703,
"sampling/sampling_logp_difference/mean": 0.0055499737150967125,
"step": 1210,
"step_time": 9.280814257636667
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.016796875,
"completions/max_length": 2035.7,
"completions/max_terminated_length": 1778.4,
"completions/mean_length": 252.879296875,
"completions/mean_terminated_length": 222.51177215576172,
"completions/min_length": 76.4,
"completions/min_terminated_length": 76.4,
"entropy": 0.1120216847397387,
"epoch": 2.612419700214133,
"frac_reward_zero_std": 0.61875,
"grad_norm": 0.6953125,
"learning_rate": 9.878100000000001e-06,
"loss": -0.0136,
"num_tokens": 138762180.0,
"reward": 0.9666211128234863,
"reward_std": 0.33665634095668795,
"rewards/reward_accuracy/mean": 0.86796875,
"rewards/reward_accuracy/std": 0.33317147493362426,
"rewards/reward_format/mean": 0.09865234419703484,
"rewards/reward_format/std": 0.009740133932791651,
"sampling/importance_sampling_ratio/max": 2.4010931253433228,
"sampling/importance_sampling_ratio/mean": 0.9836122334003449,
"sampling/importance_sampling_ratio/min": 0.006855695322155952,
"sampling/sampling_logp_difference/max": 0.7740574240684509,
"sampling/sampling_logp_difference/mean": 0.005772509099915624,
"step": 1220,
"step_time": 9.878193000052125
},
{
"clip_ratio/high_max": 3.522383922245353e-05,
"clip_ratio/high_mean": 4.4029799028066915e-06,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.4029799028066915e-06,
"completions/clipped_ratio": 0.016015625,
"completions/max_length": 1700.6,
"completions/max_terminated_length": 1379.7,
"completions/mean_length": 221.874609375,
"completions/mean_terminated_length": 192.6762924194336,
"completions/min_length": 73.6,
"completions/min_terminated_length": 73.6,
"entropy": 0.10544037567451596,
"epoch": 2.633832976445396,
"frac_reward_zero_std": 0.7125,
"grad_norm": 0.375,
"learning_rate": 9.8771e-06,
"loss": -0.0147,
"num_tokens": 139845859.0,
"reward": 0.9893750190734864,
"reward_std": 0.2851388640701771,
"rewards/reward_accuracy/mean": 0.890625,
"rewards/reward_accuracy/std": 0.282031462341547,
"rewards/reward_format/mean": 0.09875000044703483,
"rewards/reward_format/std": 0.008406375162303447,
"sampling/importance_sampling_ratio/max": 2.4298395991325377,
"sampling/importance_sampling_ratio/mean": 0.9714834153652191,
"sampling/importance_sampling_ratio/min": 0.058597370190545915,
"sampling/sampling_logp_difference/max": 0.8617385864257813,
"sampling/sampling_logp_difference/mean": 0.0056805111002177,
"step": 1230,
"step_time": 8.271268416242673
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.029296875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1841.6,
"completions/mean_length": 257.4375,
"completions/mean_terminated_length": 204.04788208007812,
"completions/min_length": 73.2,
"completions/min_terminated_length": 73.2,
"entropy": 0.11693628216162325,
"epoch": 2.6552462526766596,
"frac_reward_zero_std": 0.65625,
"grad_norm": 0.51953125,
"learning_rate": 9.8761e-06,
"loss": -0.0154,
"num_tokens": 141023491.0,
"reward": 0.9466797053813935,
"reward_std": 0.34259312748909,
"rewards/reward_accuracy/mean": 0.848828125,
"rewards/reward_accuracy/std": 0.33781424462795256,
"rewards/reward_format/mean": 0.09785156399011612,
"rewards/reward_format/std": 0.0126682810485363,
"sampling/importance_sampling_ratio/max": 2.5998017311096193,
"sampling/importance_sampling_ratio/mean": 0.9692283391952514,
"sampling/importance_sampling_ratio/min": 0.011178352450951935,
"sampling/sampling_logp_difference/max": 0.745108687877655,
"sampling/sampling_logp_difference/mean": 0.006247152853757143,
"step": 1240,
"step_time": 9.961171841062605
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1961.6,
"completions/max_terminated_length": 1624.8,
"completions/mean_length": 228.712109375,
"completions/mean_terminated_length": 205.82545166015626,
"completions/min_length": 79.9,
"completions/min_terminated_length": 79.9,
"entropy": 0.10614782492630184,
"epoch": 2.6766595289079227,
"frac_reward_zero_std": 0.6125,
"grad_norm": 0.7421875,
"learning_rate": 9.875100000000001e-06,
"loss": -0.0134,
"num_tokens": 142130498.0,
"reward": 0.9742383062839508,
"reward_std": 0.3295032739639282,
"rewards/reward_accuracy/mean": 0.875390625,
"rewards/reward_accuracy/std": 0.3269165128469467,
"rewards/reward_format/mean": 0.0988476574420929,
"rewards/reward_format/std": 0.00847327196970582,
"sampling/importance_sampling_ratio/max": 2.5346641182899474,
"sampling/importance_sampling_ratio/mean": 0.9850917160511017,
"sampling/importance_sampling_ratio/min": 0.02366028996184468,
"sampling/sampling_logp_difference/max": 0.7780488073825836,
"sampling/sampling_logp_difference/mean": 0.005560130765661597,
"step": 1250,
"step_time": 9.500657796533778
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.028125,
"completions/max_length": 1926.7,
"completions/max_terminated_length": 1746.6,
"completions/mean_length": 261.65234375,
"completions/mean_terminated_length": 210.331005859375,
"completions/min_length": 80.4,
"completions/min_terminated_length": 80.4,
"entropy": 0.12959602857008576,
"epoch": 2.6980728051391862,
"frac_reward_zero_std": 0.63125,
"grad_norm": 0.43359375,
"learning_rate": 9.874100000000001e-06,
"loss": -0.0107,
"num_tokens": 143322296.0,
"reward": 0.9438281416893005,
"reward_std": 0.3512891441583633,
"rewards/reward_accuracy/mean": 0.84609375,
"rewards/reward_accuracy/std": 0.346310780197382,
"rewards/reward_format/mean": 0.0977343775331974,
"rewards/reward_format/std": 0.012186393793672323,
"sampling/importance_sampling_ratio/max": 2.4046759724617006,
"sampling/importance_sampling_ratio/mean": 0.960819661617279,
"sampling/importance_sampling_ratio/min": 0.035607528686523435,
"sampling/sampling_logp_difference/max": 1.071310806274414,
"sampling/sampling_logp_difference/mean": 0.006372118461877107,
"step": 1260,
"step_time": 9.63373260111548
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.014453125,
"completions/max_length": 2016.6,
"completions/max_terminated_length": 1728.9,
"completions/mean_length": 228.82890625,
"completions/mean_terminated_length": 202.31111755371094,
"completions/min_length": 77.1,
"completions/min_terminated_length": 77.1,
"entropy": 0.10872721099294722,
"epoch": 2.71948608137045,
"frac_reward_zero_std": 0.6125,
"grad_norm": 0.671875,
"learning_rate": 9.8731e-06,
"loss": -0.0205,
"num_tokens": 144426130.0,
"reward": 0.9678711116313934,
"reward_std": 0.31733378022909164,
"rewards/reward_accuracy/mean": 0.869140625,
"rewards/reward_accuracy/std": 0.3142296507954597,
"rewards/reward_format/mean": 0.09873046949505807,
"rewards/reward_format/std": 0.009540182771161199,
"sampling/importance_sampling_ratio/max": 2.435129129886627,
"sampling/importance_sampling_ratio/mean": 0.9794457972049713,
"sampling/importance_sampling_ratio/min": 0.013849219679832459,
"sampling/sampling_logp_difference/max": 1.0310518503189088,
"sampling/sampling_logp_difference/mean": 0.005831611668691039,
"step": 1270,
"step_time": 9.59111021887511
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.028515625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1791.7,
"completions/mean_length": 269.673046875,
"completions/mean_terminated_length": 217.65740509033202,
"completions/min_length": 74.6,
"completions/min_terminated_length": 74.6,
"entropy": 0.13079232163727283,
"epoch": 2.7408993576017133,
"frac_reward_zero_std": 0.65,
"grad_norm": 0.75390625,
"learning_rate": 9.872100000000002e-06,
"loss": -0.0077,
"num_tokens": 145639549.0,
"reward": 0.968828159570694,
"reward_std": 0.33585931956768034,
"rewards/reward_accuracy/mean": 0.87109375,
"rewards/reward_accuracy/std": 0.3301588326692581,
"rewards/reward_format/mean": 0.0977343775331974,
"rewards/reward_format/std": 0.013139316393062473,
"sampling/importance_sampling_ratio/max": 2.4026608228683473,
"sampling/importance_sampling_ratio/mean": 0.9672911167144775,
"sampling/importance_sampling_ratio/min": 0.03189416006207466,
"sampling/sampling_logp_difference/max": 0.8492157280445098,
"sampling/sampling_logp_difference/mean": 0.0065085409674793485,
"step": 1280,
"step_time": 9.91809090906754
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.018359375,
"completions/max_length": 1891.6,
"completions/max_terminated_length": 1583.1,
"completions/mean_length": 262.328515625,
"completions/mean_terminated_length": 229.99191436767578,
"completions/min_length": 79.8,
"completions/min_terminated_length": 79.8,
"entropy": 0.1278539974242449,
"epoch": 2.7623126338329764,
"frac_reward_zero_std": 0.63125,
"grad_norm": 0.6484375,
"learning_rate": 9.871100000000001e-06,
"loss": -0.0192,
"num_tokens": 146835974.0,
"reward": 0.9775390982627868,
"reward_std": 0.30818301290273664,
"rewards/reward_accuracy/mean": 0.879296875,
"rewards/reward_accuracy/std": 0.3047086387872696,
"rewards/reward_format/mean": 0.09824218899011612,
"rewards/reward_format/std": 0.009500205283984542,
"sampling/importance_sampling_ratio/max": 2.705585479736328,
"sampling/importance_sampling_ratio/mean": 0.9697890758514405,
"sampling/importance_sampling_ratio/min": 0.02653864212334156,
"sampling/sampling_logp_difference/max": 1.2970592498779296,
"sampling/sampling_logp_difference/mean": 0.006262763729318976,
"step": 1290,
"step_time": 9.217613628599793
},
{
"clip_ratio/high_max": 1.292657689191401e-05,
"clip_ratio/high_mean": 1.6158221114892512e-06,
"clip_ratio/low_mean": 1.7566771475685527e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.372499259057804e-06,
"completions/clipped_ratio": 0.033984375,
"completions/max_length": 1991.8,
"completions/max_terminated_length": 1872.9,
"completions/mean_length": 278.7984375,
"completions/mean_terminated_length": 217.09892730712892,
"completions/min_length": 75.7,
"completions/min_terminated_length": 75.7,
"entropy": 0.1287424558773637,
"epoch": 2.78372591006424,
"frac_reward_zero_std": 0.65,
"grad_norm": 0.294921875,
"learning_rate": 9.8701e-06,
"loss": -0.0159,
"num_tokens": 148071170.0,
"reward": 0.943632847070694,
"reward_std": 0.3574570745229721,
"rewards/reward_accuracy/mean": 0.846484375,
"rewards/reward_accuracy/std": 0.350945408642292,
"rewards/reward_format/mean": 0.09714843928813935,
"rewards/reward_format/std": 0.014267935231328011,
"sampling/importance_sampling_ratio/max": 2.6756571173667907,
"sampling/importance_sampling_ratio/mean": 0.9618051469326019,
"sampling/importance_sampling_ratio/min": 0.03196396008133888,
"sampling/sampling_logp_difference/max": 0.8176993787288666,
"sampling/sampling_logp_difference/mean": 0.006301799556240439,
"step": 1300,
"step_time": 10.110669854655862
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01328125,
"completions/max_length": 1886.2,
"completions/max_terminated_length": 1755.1,
"completions/mean_length": 208.4359375,
"completions/mean_terminated_length": 183.69110565185548,
"completions/min_length": 72.9,
"completions/min_terminated_length": 72.9,
"entropy": 0.09744282835163176,
"epoch": 2.805139186295503,
"frac_reward_zero_std": 0.68125,
"grad_norm": 0.68359375,
"learning_rate": 9.8691e-06,
"loss": -0.0101,
"num_tokens": 149125486.0,
"reward": 1.002324217557907,
"reward_std": 0.28990163207054137,
"rewards/reward_accuracy/mean": 0.903515625,
"rewards/reward_accuracy/std": 0.28665773421525953,
"rewards/reward_format/mean": 0.09880859404802322,
"rewards/reward_format/std": 0.008398479758761823,
"sampling/importance_sampling_ratio/max": 2.3627427935600283,
"sampling/importance_sampling_ratio/mean": 0.9728740334510804,
"sampling/importance_sampling_ratio/min": 0.06787963543320075,
"sampling/sampling_logp_difference/max": 1.1454557836055757,
"sampling/sampling_logp_difference/mean": 0.0055387520231306555,
"step": 1310,
"step_time": 8.949888131720945
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.1166080639668508e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.1166080639668508e-06,
"completions/clipped_ratio": 0.027734375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1895.5,
"completions/mean_length": 265.8078125,
"completions/mean_terminated_length": 215.25103759765625,
"completions/min_length": 72.1,
"completions/min_terminated_length": 72.1,
"entropy": 0.13212055033072828,
"epoch": 2.8265524625267666,
"frac_reward_zero_std": 0.68125,
"grad_norm": 0.8046875,
"learning_rate": 9.868100000000001e-06,
"loss": -0.0074,
"num_tokens": 150321618.0,
"reward": 0.9635742485523224,
"reward_std": 0.3318389028310776,
"rewards/reward_accuracy/mean": 0.866015625,
"rewards/reward_accuracy/std": 0.32621782422065737,
"rewards/reward_format/mean": 0.09755859449505806,
"rewards/reward_format/std": 0.013055017055012285,
"sampling/importance_sampling_ratio/max": 2.520074892044067,
"sampling/importance_sampling_ratio/mean": 0.9740135073661804,
"sampling/importance_sampling_ratio/min": 0.026898569241166116,
"sampling/sampling_logp_difference/max": 0.770736175775528,
"sampling/sampling_logp_difference/mean": 0.006190569372847676,
"step": 1320,
"step_time": 10.324230469809844
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 6.663112799287774e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 6.663112799287774e-07,
"completions/clipped_ratio": 0.025390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1775.2,
"completions/mean_length": 241.74765625,
"completions/mean_terminated_length": 194.9777359008789,
"completions/min_length": 67.7,
"completions/min_terminated_length": 67.7,
"entropy": 0.11845294418744742,
"epoch": 2.84796573875803,
"frac_reward_zero_std": 0.7375,
"grad_norm": 0.69140625,
"learning_rate": 9.8671e-06,
"loss": -0.0135,
"num_tokens": 151453660.0,
"reward": 1.000585961341858,
"reward_std": 0.29446490556001664,
"rewards/reward_accuracy/mean": 0.902734375,
"rewards/reward_accuracy/std": 0.288523930311203,
"rewards/reward_format/mean": 0.09785156473517417,
"rewards/reward_format/std": 0.012423273362219333,
"sampling/importance_sampling_ratio/max": 2.3728586077690124,
"sampling/importance_sampling_ratio/mean": 0.9622783422470093,
"sampling/importance_sampling_ratio/min": 0.0018273277208209037,
"sampling/sampling_logp_difference/max": 0.7746831357479096,
"sampling/sampling_logp_difference/mean": 0.00582157033495605,
"step": 1330,
"step_time": 10.209967277850955
},
{
"clip_ratio/high_max": 4.991348396288231e-06,
"clip_ratio/high_mean": 6.239185495360288e-07,
"clip_ratio/low_mean": 8.930067178880562e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 9.553985682941856e-06,
"completions/clipped_ratio": 0.039453125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1810.6,
"completions/mean_length": 288.835546875,
"completions/mean_terminated_length": 217.15137176513673,
"completions/min_length": 65.6,
"completions/min_terminated_length": 65.6,
"entropy": 0.15344584831036628,
"epoch": 2.8693790149892933,
"frac_reward_zero_std": 0.6125,
"grad_norm": 0.65234375,
"learning_rate": 9.8661e-06,
"loss": -0.0204,
"num_tokens": 152707831.0,
"reward": 0.941875022649765,
"reward_std": 0.35643901228904723,
"rewards/reward_accuracy/mean": 0.844921875,
"rewards/reward_accuracy/std": 0.34984373599290847,
"rewards/reward_format/mean": 0.09695312455296516,
"rewards/reward_format/std": 0.015183501690626145,
"sampling/importance_sampling_ratio/max": 2.628102970123291,
"sampling/importance_sampling_ratio/mean": 0.9503216683864594,
"sampling/importance_sampling_ratio/min": 0.003284785896539688,
"sampling/sampling_logp_difference/max": 1.0976083636283875,
"sampling/sampling_logp_difference/mean": 0.006922589475288987,
"step": 1340,
"step_time": 10.6404555327259
},
{
"clip_ratio/high_max": 2.0133091311436146e-05,
"clip_ratio/high_mean": 2.5166364139295183e-06,
"clip_ratio/low_mean": 2.0243971448508093e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.541033558780328e-06,
"completions/clipped_ratio": 0.0375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1836.6,
"completions/mean_length": 299.09296875,
"completions/mean_terminated_length": 231.51004028320312,
"completions/min_length": 72.4,
"completions/min_terminated_length": 72.4,
"entropy": 0.14960660738870502,
"epoch": 2.890792291220557,
"frac_reward_zero_std": 0.63125,
"grad_norm": 0.2138671875,
"learning_rate": 9.865100000000001e-06,
"loss": -0.0269,
"num_tokens": 153993157.0,
"reward": 0.9589258074760437,
"reward_std": 0.3412553042173386,
"rewards/reward_accuracy/mean": 0.86171875,
"rewards/reward_accuracy/std": 0.3356348142027855,
"rewards/reward_format/mean": 0.09720703214406967,
"rewards/reward_format/std": 0.014078139141201974,
"sampling/importance_sampling_ratio/max": 2.555004930496216,
"sampling/importance_sampling_ratio/mean": 0.9512849867343902,
"sampling/importance_sampling_ratio/min": 0.0030088335275650024,
"sampling/sampling_logp_difference/max": 1.5254368782043457,
"sampling/sampling_logp_difference/mean": 0.006909074913710356,
"step": 1350,
"step_time": 10.67657860480249
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.028125,
"completions/max_length": 1900.8,
"completions/max_terminated_length": 1795.6,
"completions/mean_length": 288.038671875,
"completions/mean_terminated_length": 237.45382995605468,
"completions/min_length": 76.1,
"completions/min_terminated_length": 76.1,
"entropy": 0.143941687932238,
"epoch": 2.91220556745182,
"frac_reward_zero_std": 0.6375,
"grad_norm": 0.75390625,
"learning_rate": 9.864100000000001e-06,
"loss": -0.0209,
"num_tokens": 155255064.0,
"reward": 0.9686133027076721,
"reward_std": 0.32756122648715974,
"rewards/reward_accuracy/mean": 0.87109375,
"rewards/reward_accuracy/std": 0.32222829312086104,
"rewards/reward_format/mean": 0.09751953333616256,
"rewards/reward_format/std": 0.012957901414483785,
"sampling/importance_sampling_ratio/max": 2.6038841724395754,
"sampling/importance_sampling_ratio/mean": 0.9601919770240783,
"sampling/importance_sampling_ratio/min": 0.03949383832514286,
"sampling/sampling_logp_difference/max": 0.9934428691864013,
"sampling/sampling_logp_difference/mean": 0.006732242181897163,
"step": 1360,
"step_time": 9.494218508386984
},
{
"clip_ratio/high_max": 2.635635028127581e-05,
"clip_ratio/high_mean": 3.2945437851594763e-06,
"clip_ratio/low_mean": 2.210972206739825e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 5.505515991899301e-06,
"completions/clipped_ratio": 0.034375,
"completions/max_length": 1982.7,
"completions/max_terminated_length": 1787.8,
"completions/mean_length": 285.52578125,
"completions/mean_terminated_length": 223.00097045898437,
"completions/min_length": 72.8,
"completions/min_terminated_length": 72.8,
"entropy": 0.1397873640526086,
"epoch": 2.9336188436830835,
"frac_reward_zero_std": 0.65,
"grad_norm": 0.84375,
"learning_rate": 9.8631e-06,
"loss": -0.0032,
"num_tokens": 156499978.0,
"reward": 0.9865820467472076,
"reward_std": 0.3123451009392738,
"rewards/reward_accuracy/mean": 0.8890625,
"rewards/reward_accuracy/std": 0.3060625419020653,
"rewards/reward_format/mean": 0.09751953482627869,
"rewards/reward_format/std": 0.013042040448635817,
"sampling/importance_sampling_ratio/max": 2.5193291306495667,
"sampling/importance_sampling_ratio/mean": 0.9671801090240478,
"sampling/importance_sampling_ratio/min": 0.005964728444814682,
"sampling/sampling_logp_difference/max": 0.9094330310821533,
"sampling/sampling_logp_difference/mean": 0.006431865599006414,
"step": 1370,
"step_time": 9.875170447817073
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.4612377071898664e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.4612377071898664e-06,
"completions/clipped_ratio": 0.02265625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1906.3,
"completions/mean_length": 251.055859375,
"completions/mean_terminated_length": 209.5852310180664,
"completions/min_length": 69.7,
"completions/min_terminated_length": 69.7,
"entropy": 0.12507415413856507,
"epoch": 2.955032119914347,
"frac_reward_zero_std": 0.66875,
"grad_norm": 0.5546875,
"learning_rate": 9.862100000000002e-06,
"loss": -0.0179,
"num_tokens": 157658489.0,
"reward": 0.9856054842472076,
"reward_std": 0.30150564163923266,
"rewards/reward_accuracy/mean": 0.8875,
"rewards/reward_accuracy/std": 0.2964631341397762,
"rewards/reward_format/mean": 0.09810546860098839,
"rewards/reward_format/std": 0.011590168438851833,
"sampling/importance_sampling_ratio/max": 2.397749125957489,
"sampling/importance_sampling_ratio/mean": 0.9672664165496826,
"sampling/importance_sampling_ratio/min": 0.01951782018877566,
"sampling/sampling_logp_difference/max": 0.8342133939266205,
"sampling/sampling_logp_difference/mean": 0.006047966657206416,
"step": 1380,
"step_time": 10.104428648622706
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.1982757971272802e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.1982757971272802e-06,
"completions/clipped_ratio": 0.01640625,
"completions/max_length": 1875.4,
"completions/max_terminated_length": 1630.8,
"completions/mean_length": 221.80859375,
"completions/mean_terminated_length": 191.29249725341796,
"completions/min_length": 68.3,
"completions/min_terminated_length": 68.3,
"entropy": 0.11596635873429477,
"epoch": 2.9764453961456105,
"frac_reward_zero_std": 0.725,
"grad_norm": 0.5078125,
"learning_rate": 9.861100000000001e-06,
"loss": -0.0029,
"num_tokens": 158738735.0,
"reward": 0.9977734506130218,
"reward_std": 0.2801591753959656,
"rewards/reward_accuracy/mean": 0.89921875,
"rewards/reward_accuracy/std": 0.2758606433868408,
"rewards/reward_format/mean": 0.0985546886920929,
"rewards/reward_format/std": 0.00975913885049522,
"sampling/importance_sampling_ratio/max": 2.377631413936615,
"sampling/importance_sampling_ratio/mean": 0.9857850909233093,
"sampling/importance_sampling_ratio/min": 0.0,
"sampling/sampling_logp_difference/max": 0.7392346024513244,
"sampling/sampling_logp_difference/mean": 0.005586580093950033,
"step": 1390,
"step_time": 9.168195472005754
},
{
"clip_ratio/high_max": 2.4549842783017085e-05,
"clip_ratio/high_mean": 3.0687303478771357e-06,
"clip_ratio/low_mean": 3.586512434594624e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 6.65524278247176e-06,
"completions/clipped_ratio": 0.0234375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1822.9,
"completions/mean_length": 252.641015625,
"completions/mean_terminated_length": 209.3615692138672,
"completions/min_length": 72.0,
"completions/min_terminated_length": 72.0,
"entropy": 0.12869733683764933,
"epoch": 2.9978586723768736,
"frac_reward_zero_std": 0.675,
"grad_norm": 0.6484375,
"learning_rate": 9.8601e-06,
"loss": -0.0134,
"num_tokens": 159901448.0,
"reward": 0.9803515791893005,
"reward_std": 0.32386000752449035,
"rewards/reward_accuracy/mean": 0.882421875,
"rewards/reward_accuracy/std": 0.3183260202407837,
"rewards/reward_format/mean": 0.09792969077825546,
"rewards/reward_format/std": 0.012549743638373911,
"sampling/importance_sampling_ratio/max": 2.6030848026275635,
"sampling/importance_sampling_ratio/mean": 0.9746620714664459,
"sampling/importance_sampling_ratio/min": 0.004979809746146202,
"sampling/sampling_logp_difference/max": 0.928394103050232,
"sampling/sampling_logp_difference/mean": 0.006141010578721762,
"step": 1400,
"step_time": 10.237090529641137
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0234375,
"completions/max_length": 2003.7,
"completions/max_terminated_length": 1929.3,
"completions/mean_length": 278.990234375,
"completions/mean_terminated_length": 237.19077758789064,
"completions/min_length": 70.9,
"completions/min_terminated_length": 70.9,
"entropy": 0.13723228890448808,
"epoch": 3.019271948608137,
"frac_reward_zero_std": 0.6875,
"grad_norm": 0.234375,
"learning_rate": 9.8591e-06,
"loss": -0.0137,
"num_tokens": 161130815.0,
"reward": 0.9694726943969727,
"reward_std": 0.3122725859284401,
"rewards/reward_accuracy/mean": 0.871875,
"rewards/reward_accuracy/std": 0.30731979161500933,
"rewards/reward_format/mean": 0.09759765863418579,
"rewards/reward_format/std": 0.012566167674958707,
"sampling/importance_sampling_ratio/max": 2.433853769302368,
"sampling/importance_sampling_ratio/mean": 0.9620497286319732,
"sampling/importance_sampling_ratio/min": 0.005554328300058841,
"sampling/sampling_logp_difference/max": 1.010851502418518,
"sampling/sampling_logp_difference/mean": 0.006218926748260856,
"step": 1410,
"step_time": 9.85424626157619
},
{
"clip_ratio/high_max": 1.7988806939683853e-05,
"clip_ratio/high_mean": 2.2486008674604817e-06,
"clip_ratio/low_mean": 2.498001549611217e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.498401045158971e-06,
"completions/clipped_ratio": 0.025390625,
"completions/max_length": 2034.3,
"completions/max_terminated_length": 1807.4,
"completions/mean_length": 249.11875,
"completions/mean_terminated_length": 202.41503448486327,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.12095137531869113,
"epoch": 3.0406852248394003,
"frac_reward_zero_std": 0.68125,
"grad_norm": 0.265625,
"learning_rate": 9.8581e-06,
"loss": -0.0247,
"num_tokens": 162286927.0,
"reward": 0.9686133027076721,
"reward_std": 0.33186696469783783,
"rewards/reward_accuracy/mean": 0.870703125,
"rewards/reward_accuracy/std": 0.3270107865333557,
"rewards/reward_format/mean": 0.09791015759110451,
"rewards/reward_format/std": 0.011695434665307402,
"sampling/importance_sampling_ratio/max": 2.566501998901367,
"sampling/importance_sampling_ratio/mean": 0.9749084770679474,
"sampling/importance_sampling_ratio/min": 0.0803227648139,
"sampling/sampling_logp_difference/max": 0.8581221640110016,
"sampling/sampling_logp_difference/mean": 0.006047851219773292,
"step": 1420,
"step_time": 9.977447223011405
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.027734375,
"completions/max_length": 1990.0,
"completions/max_terminated_length": 1761.9,
"completions/mean_length": 253.055859375,
"completions/mean_terminated_length": 202.3875717163086,
"completions/min_length": 71.0,
"completions/min_terminated_length": 71.0,
"entropy": 0.11509081302210689,
"epoch": 3.062098501070664,
"frac_reward_zero_std": 0.65625,
"grad_norm": 0.609375,
"learning_rate": 9.857100000000001e-06,
"loss": -0.0139,
"num_tokens": 163452014.0,
"reward": 1.0019336283206939,
"reward_std": 0.29161686897277833,
"rewards/reward_accuracy/mean": 0.904296875,
"rewards/reward_accuracy/std": 0.2856085702776909,
"rewards/reward_format/mean": 0.09763671904802322,
"rewards/reward_format/std": 0.013012240128591656,
"sampling/importance_sampling_ratio/max": 2.3530020475387574,
"sampling/importance_sampling_ratio/mean": 0.9724257826805115,
"sampling/importance_sampling_ratio/min": 0.015552429109811782,
"sampling/sampling_logp_difference/max": 0.956920462846756,
"sampling/sampling_logp_difference/mean": 0.005738818645477295,
"step": 1430,
"step_time": 9.866882085939869
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.022265625,
"completions/max_length": 1930.8,
"completions/max_terminated_length": 1824.3,
"completions/mean_length": 238.0984375,
"completions/mean_terminated_length": 197.4676971435547,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.1252144178841263,
"epoch": 3.0835117773019274,
"frac_reward_zero_std": 0.7,
"grad_norm": 0.78125,
"learning_rate": 9.8561e-06,
"loss": -0.0126,
"num_tokens": 164576826.0,
"reward": 0.9647656500339508,
"reward_std": 0.3372309297323227,
"rewards/reward_accuracy/mean": 0.866796875,
"rewards/reward_accuracy/std": 0.3327026396989822,
"rewards/reward_format/mean": 0.09796875193715096,
"rewards/reward_format/std": 0.010998245584778488,
"sampling/importance_sampling_ratio/max": 2.5164348125457763,
"sampling/importance_sampling_ratio/mean": 0.9726768434047699,
"sampling/importance_sampling_ratio/min": 0.01041568573564291,
"sampling/sampling_logp_difference/max": 1.1080944299697877,
"sampling/sampling_logp_difference/mean": 0.0062936225440353155,
"step": 1440,
"step_time": 9.412317692255602
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.3757784245171933e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.3757784245171933e-06,
"completions/clipped_ratio": 0.025,
"completions/max_length": 1949.1,
"completions/max_terminated_length": 1610.0,
"completions/mean_length": 243.452734375,
"completions/mean_terminated_length": 197.92351989746095,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.11817612624727189,
"epoch": 3.1049250535331905,
"frac_reward_zero_std": 0.6875,
"grad_norm": 0.875,
"learning_rate": 9.855100000000002e-06,
"loss": -0.0026,
"num_tokens": 165712161.0,
"reward": 0.975488293170929,
"reward_std": 0.3212460920214653,
"rewards/reward_accuracy/mean": 0.877734375,
"rewards/reward_accuracy/std": 0.3161662548780441,
"rewards/reward_format/mean": 0.09775390625,
"rewards/reward_format/std": 0.01206508711911738,
"sampling/importance_sampling_ratio/max": 2.638550853729248,
"sampling/importance_sampling_ratio/mean": 0.9678310573101043,
"sampling/importance_sampling_ratio/min": 0.07146952655166387,
"sampling/sampling_logp_difference/max": 0.8822963893413543,
"sampling/sampling_logp_difference/mean": 0.005902142636477948,
"step": 1450,
"step_time": 9.733207228221
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02109375,
"completions/max_length": 1837.7,
"completions/max_terminated_length": 1598.1,
"completions/mean_length": 238.8578125,
"completions/mean_terminated_length": 200.35666046142578,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.10323442900553345,
"epoch": 3.126338329764454,
"frac_reward_zero_std": 0.725,
"grad_norm": 0.58984375,
"learning_rate": 9.854100000000001e-06,
"loss": -0.004,
"num_tokens": 166837541.0,
"reward": 0.9797656536102295,
"reward_std": 0.3173313230276108,
"rewards/reward_accuracy/mean": 0.881640625,
"rewards/reward_accuracy/std": 0.3126935824751854,
"rewards/reward_format/mean": 0.09812500178813935,
"rewards/reward_format/std": 0.01072554155252874,
"sampling/importance_sampling_ratio/max": 2.5114275574684144,
"sampling/importance_sampling_ratio/mean": 0.9727673649787902,
"sampling/importance_sampling_ratio/min": 0.08591321557760238,
"sampling/sampling_logp_difference/max": 0.8079095959663392,
"sampling/sampling_logp_difference/mean": 0.00534597304649651,
"step": 1460,
"step_time": 9.268999901600182
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.014453125,
"completions/max_length": 1841.5,
"completions/max_terminated_length": 1475.6,
"completions/mean_length": 195.7140625,
"completions/mean_terminated_length": 168.81556243896483,
"completions/min_length": 60.0,
"completions/min_terminated_length": 60.0,
"entropy": 0.08325513992458582,
"epoch": 3.147751605995717,
"frac_reward_zero_std": 0.7625,
"grad_norm": 0.58984375,
"learning_rate": 9.8531e-06,
"loss": -0.0113,
"num_tokens": 167847753.0,
"reward": 1.0167773604393004,
"reward_std": 0.2673481568694115,
"rewards/reward_accuracy/mean": 0.91796875,
"rewards/reward_accuracy/std": 0.2637575134634972,
"rewards/reward_format/mean": 0.09880859404802322,
"rewards/reward_format/std": 0.008614166686311365,
"sampling/importance_sampling_ratio/max": 2.4897693157196046,
"sampling/importance_sampling_ratio/mean": 0.993402773141861,
"sampling/importance_sampling_ratio/min": 0.08831279370933771,
"sampling/sampling_logp_difference/max": 0.6990828573703766,
"sampling/sampling_logp_difference/mean": 0.004966791812330484,
"step": 1470,
"step_time": 9.222663557855412
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01484375,
"completions/max_length": 1968.7,
"completions/max_terminated_length": 1637.0,
"completions/mean_length": 214.640625,
"completions/mean_terminated_length": 187.1670883178711,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.10344052617438138,
"epoch": 3.1691648822269807,
"frac_reward_zero_std": 0.68125,
"grad_norm": 0.435546875,
"learning_rate": 9.852100000000002e-06,
"loss": -0.0066,
"num_tokens": 168914545.0,
"reward": 0.9913672089576722,
"reward_std": 0.29082458913326265,
"rewards/reward_accuracy/mean": 0.892578125,
"rewards/reward_accuracy/std": 0.2873623199760914,
"rewards/reward_format/mean": 0.0987890638411045,
"rewards/reward_format/std": 0.008891093893907964,
"sampling/importance_sampling_ratio/max": 2.550092577934265,
"sampling/importance_sampling_ratio/mean": 0.9754530787467957,
"sampling/importance_sampling_ratio/min": 0.017640766501426697,
"sampling/sampling_logp_difference/max": 0.8832846045494079,
"sampling/sampling_logp_difference/mean": 0.0054925293661653996,
"step": 1480,
"step_time": 9.442868809076026
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.019140625,
"completions/max_length": 2027.7,
"completions/max_terminated_length": 1767.8,
"completions/mean_length": 252.796484375,
"completions/mean_terminated_length": 218.5821319580078,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"entropy": 0.1094044059049338,
"epoch": 3.190578158458244,
"frac_reward_zero_std": 0.65625,
"grad_norm": 0.81640625,
"learning_rate": 9.851100000000001e-06,
"loss": -0.0177,
"num_tokens": 170085240.0,
"reward": 0.9426172256469727,
"reward_std": 0.33308871239423754,
"rewards/reward_accuracy/mean": 0.844140625,
"rewards/reward_accuracy/std": 0.3293738439679146,
"rewards/reward_format/mean": 0.09847656413912773,
"rewards/reward_format/std": 0.01100408979691565,
"sampling/importance_sampling_ratio/max": 2.428274416923523,
"sampling/importance_sampling_ratio/mean": 0.9697591602802277,
"sampling/importance_sampling_ratio/min": 0.0492352195084095,
"sampling/sampling_logp_difference/max": 0.7653342425823212,
"sampling/sampling_logp_difference/mean": 0.005660760030150413,
"step": 1490,
"step_time": 9.919875398231671
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0234375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1798.4,
"completions/mean_length": 247.023828125,
"completions/mean_terminated_length": 204.11618194580078,
"completions/min_length": 71.3,
"completions/min_terminated_length": 71.3,
"entropy": 0.10743768666870893,
"epoch": 3.2119914346895073,
"frac_reward_zero_std": 0.73125,
"grad_norm": 0.45703125,
"learning_rate": 9.8501e-06,
"loss": -0.0089,
"num_tokens": 171232725.0,
"reward": 1.0013672232627868,
"reward_std": 0.29078521728515627,
"rewards/reward_accuracy/mean": 0.903125,
"rewards/reward_accuracy/std": 0.28583550453186035,
"rewards/reward_format/mean": 0.09824219122529029,
"rewards/reward_format/std": 0.011509055038914084,
"sampling/importance_sampling_ratio/max": 2.3975042581558226,
"sampling/importance_sampling_ratio/mean": 0.9662628412246704,
"sampling/importance_sampling_ratio/min": 0.0,
"sampling/sampling_logp_difference/max": 0.9585851073265076,
"sampling/sampling_logp_difference/mean": 0.005507629457861185,
"step": 1500,
"step_time": 10.07339425184764
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.021875,
"completions/max_length": 1988.4,
"completions/max_terminated_length": 1854.4,
"completions/mean_length": 251.553515625,
"completions/mean_terminated_length": 212.00378875732423,
"completions/min_length": 73.2,
"completions/min_terminated_length": 73.2,
"entropy": 0.1175171316601336,
"epoch": 3.233404710920771,
"frac_reward_zero_std": 0.68125,
"grad_norm": 0.1103515625,
"learning_rate": 9.8491e-06,
"loss": -0.0142,
"num_tokens": 172398062.0,
"reward": 0.9636133074760437,
"reward_std": 0.322995688021183,
"rewards/reward_accuracy/mean": 0.865234375,
"rewards/reward_accuracy/std": 0.31946829706430435,
"rewards/reward_format/mean": 0.09837890714406967,
"rewards/reward_format/std": 0.010151281487196684,
"sampling/importance_sampling_ratio/max": 2.3881723642349244,
"sampling/importance_sampling_ratio/mean": 0.9565789520740509,
"sampling/importance_sampling_ratio/min": 0.04415746591985226,
"sampling/sampling_logp_difference/max": 0.8253163397312164,
"sampling/sampling_logp_difference/mean": 0.006040327297523618,
"step": 1510,
"step_time": 9.837803109781817
},
{
"clip_ratio/high_max": 2.0112631318625064e-06,
"clip_ratio/high_mean": 2.514078914828133e-07,
"clip_ratio/low_mean": 2.0195676370349248e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.270975528517738e-06,
"completions/clipped_ratio": 0.02265625,
"completions/max_length": 1906.1,
"completions/max_terminated_length": 1748.8,
"completions/mean_length": 230.130078125,
"completions/mean_terminated_length": 188.74163055419922,
"completions/min_length": 69.7,
"completions/min_terminated_length": 69.7,
"entropy": 0.10287722870707512,
"epoch": 3.2548179871520344,
"frac_reward_zero_std": 0.75625,
"grad_norm": 0.4453125,
"learning_rate": 9.8481e-06,
"loss": -0.0058,
"num_tokens": 173504395.0,
"reward": 0.9755273699760437,
"reward_std": 0.325254288315773,
"rewards/reward_accuracy/mean": 0.87734375,
"rewards/reward_accuracy/std": 0.3208487004041672,
"rewards/reward_format/mean": 0.09818359538912773,
"rewards/reward_format/std": 0.011022813338786363,
"sampling/importance_sampling_ratio/max": 2.688767433166504,
"sampling/importance_sampling_ratio/mean": 0.9754761040210724,
"sampling/importance_sampling_ratio/min": 0.04700644984841347,
"sampling/sampling_logp_difference/max": 0.6892714321613311,
"sampling/sampling_logp_difference/mean": 0.0055665292777121065,
"step": 1520,
"step_time": 9.480419942410663
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 1801.7,
"completions/max_terminated_length": 1567.3,
"completions/mean_length": 214.331640625,
"completions/mean_terminated_length": 193.00943756103516,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.09125048737041652,
"epoch": 3.2762312633832975,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.6171875,
"learning_rate": 9.847100000000001e-06,
"loss": -0.0078,
"num_tokens": 174570684.0,
"reward": 0.9969335973262787,
"reward_std": 0.2909061387181282,
"rewards/reward_accuracy/mean": 0.898046875,
"rewards/reward_accuracy/std": 0.28805461525917053,
"rewards/reward_format/mean": 0.09888671934604645,
"rewards/reward_format/std": 0.007716428674757481,
"sampling/importance_sampling_ratio/max": 2.5195098876953126,
"sampling/importance_sampling_ratio/mean": 0.9786329984664917,
"sampling/importance_sampling_ratio/min": 0.13934081960469485,
"sampling/sampling_logp_difference/max": 0.6875298023223877,
"sampling/sampling_logp_difference/mean": 0.005134655721485614,
"step": 1530,
"step_time": 8.833215132448823
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.814697265625e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.814697265625e-07,
"completions/clipped_ratio": 0.023046875,
"completions/max_length": 1863.7,
"completions/max_terminated_length": 1499.1,
"completions/mean_length": 236.780859375,
"completions/mean_terminated_length": 194.81019744873046,
"completions/min_length": 67.8,
"completions/min_terminated_length": 67.8,
"entropy": 0.10944453040137887,
"epoch": 3.297644539614561,
"frac_reward_zero_std": 0.725,
"grad_norm": 0.59375,
"learning_rate": 9.8461e-06,
"loss": -0.0081,
"num_tokens": 175705611.0,
"reward": 0.9695898711681366,
"reward_std": 0.3202429562807083,
"rewards/reward_accuracy/mean": 0.871484375,
"rewards/reward_accuracy/std": 0.3156054921448231,
"rewards/reward_format/mean": 0.09810546860098839,
"rewards/reward_format/std": 0.011071567120961846,
"sampling/importance_sampling_ratio/max": 2.437493693828583,
"sampling/importance_sampling_ratio/mean": 0.9736605882644653,
"sampling/importance_sampling_ratio/min": 0.04200255274772644,
"sampling/sampling_logp_difference/max": 0.9007036030292511,
"sampling/sampling_logp_difference/mean": 0.0058080647373571995,
"step": 1540,
"step_time": 9.295246765529736
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1955.8,
"completions/max_terminated_length": 1795.3,
"completions/mean_length": 217.137109375,
"completions/mean_terminated_length": 196.95730285644532,
"completions/min_length": 65.7,
"completions/min_terminated_length": 65.7,
"entropy": 0.10079648671671748,
"epoch": 3.3190578158458246,
"frac_reward_zero_std": 0.7,
"grad_norm": 0.43359375,
"learning_rate": 9.8451e-06,
"loss": -0.0106,
"num_tokens": 176782842.0,
"reward": 1.0094531536102296,
"reward_std": 0.2836147084832191,
"rewards/reward_accuracy/mean": 0.910546875,
"rewards/reward_accuracy/std": 0.28076811879873276,
"rewards/reward_format/mean": 0.09890625104308129,
"rewards/reward_format/std": 0.00827403082512319,
"sampling/importance_sampling_ratio/max": 2.4991987705230714,
"sampling/importance_sampling_ratio/mean": 0.9758339107036591,
"sampling/importance_sampling_ratio/min": 0.06347680613398551,
"sampling/sampling_logp_difference/max": 1.3269277930259704,
"sampling/sampling_logp_difference/mean": 0.005482628429308534,
"step": 1550,
"step_time": 9.376380105037242
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1708.2,
"completions/max_terminated_length": 1499.3,
"completions/mean_length": 212.085546875,
"completions/mean_terminated_length": 198.5985321044922,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.09452715474180877,
"epoch": 3.3404710920770877,
"frac_reward_zero_std": 0.6625,
"grad_norm": 0.70703125,
"learning_rate": 9.844100000000001e-06,
"loss": -0.0122,
"num_tokens": 177846261.0,
"reward": 0.9764648616313935,
"reward_std": 0.30377777814865115,
"rewards/reward_accuracy/mean": 0.87734375,
"rewards/reward_accuracy/std": 0.30150182396173475,
"rewards/reward_format/mean": 0.09912109524011611,
"rewards/reward_format/std": 0.0066042895894497635,
"sampling/importance_sampling_ratio/max": 2.5027692794799803,
"sampling/importance_sampling_ratio/mean": 0.9836281895637512,
"sampling/importance_sampling_ratio/min": 0.1032183650881052,
"sampling/sampling_logp_difference/max": 0.7078694939613343,
"sampling/sampling_logp_difference/mean": 0.00528716454282403,
"step": 1560,
"step_time": 8.054320692783222
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 1802.8,
"completions/max_terminated_length": 1488.7,
"completions/mean_length": 214.573046875,
"completions/mean_terminated_length": 185.71929626464845,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.09765789494849741,
"epoch": 3.3618843683083512,
"frac_reward_zero_std": 0.74375,
"grad_norm": 1.6328125,
"learning_rate": 9.8431e-06,
"loss": -0.008,
"num_tokens": 178914960.0,
"reward": 0.9943945467472076,
"reward_std": 0.28839647620916364,
"rewards/reward_accuracy/mean": 0.895703125,
"rewards/reward_accuracy/std": 0.28460960686206815,
"rewards/reward_format/mean": 0.09869140833616256,
"rewards/reward_format/std": 0.008625720767304302,
"sampling/importance_sampling_ratio/max": 2.5256597280502318,
"sampling/importance_sampling_ratio/mean": 0.9805302441120147,
"sampling/importance_sampling_ratio/min": 0.056228873692452906,
"sampling/sampling_logp_difference/max": 1.3031443059444427,
"sampling/sampling_logp_difference/mean": 0.0052451096707955,
"step": 1570,
"step_time": 8.856824438786134
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1794.9,
"completions/max_terminated_length": 1689.5,
"completions/mean_length": 215.741796875,
"completions/mean_terminated_length": 198.81375885009766,
"completions/min_length": 71.7,
"completions/min_terminated_length": 71.7,
"entropy": 0.10482313577085733,
"epoch": 3.3832976445396143,
"frac_reward_zero_std": 0.7125,
"grad_norm": 0.6875,
"learning_rate": 9.842100000000002e-06,
"loss": -0.0098,
"num_tokens": 179985243.0,
"reward": 1.0030664324760437,
"reward_std": 0.27728412449359896,
"rewards/reward_accuracy/mean": 0.90390625,
"rewards/reward_accuracy/std": 0.2752255484461784,
"rewards/reward_format/mean": 0.09916015714406967,
"rewards/reward_format/std": 0.005877672834321857,
"sampling/importance_sampling_ratio/max": 2.546773409843445,
"sampling/importance_sampling_ratio/mean": 0.9776469528675079,
"sampling/importance_sampling_ratio/min": 0.05178725719451904,
"sampling/sampling_logp_difference/max": 0.7995202422142029,
"sampling/sampling_logp_difference/mean": 0.005538750346750021,
"step": 1580,
"step_time": 8.664407610148192
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012890625,
"completions/max_length": 1773.6,
"completions/max_terminated_length": 1518.1,
"completions/mean_length": 233.84296875,
"completions/mean_terminated_length": 210.51532287597655,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.10804593018256128,
"epoch": 3.404710920770878,
"frac_reward_zero_std": 0.6625,
"grad_norm": 0.69140625,
"learning_rate": 9.841100000000001e-06,
"loss": -0.0145,
"num_tokens": 181105001.0,
"reward": 0.9642187774181366,
"reward_std": 0.336383818089962,
"rewards/reward_accuracy/mean": 0.865234375,
"rewards/reward_accuracy/std": 0.33429116755723953,
"rewards/reward_format/mean": 0.0989843763411045,
"rewards/reward_format/std": 0.006461745174601674,
"sampling/importance_sampling_ratio/max": 2.6101008892059325,
"sampling/importance_sampling_ratio/mean": 0.9739734888076782,
"sampling/importance_sampling_ratio/min": 0.062481099367141725,
"sampling/sampling_logp_difference/max": 1.2041119575500487,
"sampling/sampling_logp_difference/mean": 0.005752623546868563,
"step": 1590,
"step_time": 8.411912427516654
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0203125,
"completions/max_length": 1893.8,
"completions/max_terminated_length": 1761.6,
"completions/mean_length": 257.691015625,
"completions/mean_terminated_length": 220.87854766845703,
"completions/min_length": 67.2,
"completions/min_terminated_length": 67.2,
"entropy": 0.11991393552161753,
"epoch": 3.4261241970021414,
"frac_reward_zero_std": 0.66875,
"grad_norm": 0.71875,
"learning_rate": 9.840100000000001e-06,
"loss": -0.0189,
"num_tokens": 182280386.0,
"reward": 0.9609570562839508,
"reward_std": 0.33747961819171907,
"rewards/reward_accuracy/mean": 0.862890625,
"rewards/reward_accuracy/std": 0.33302130103111266,
"rewards/reward_format/mean": 0.09806640893220901,
"rewards/reward_format/std": 0.011156254401430487,
"sampling/importance_sampling_ratio/max": 2.5625220775604247,
"sampling/importance_sampling_ratio/mean": 0.9592302560806274,
"sampling/importance_sampling_ratio/min": 0.04947969317436218,
"sampling/sampling_logp_difference/max": 0.7355604290962219,
"sampling/sampling_logp_difference/mean": 0.005925694527104497,
"step": 1600,
"step_time": 9.166617392422632
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.5751032833577483e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.5751032833577483e-06,
"completions/clipped_ratio": 0.0171875,
"completions/max_length": 1674.3,
"completions/max_terminated_length": 1501.0,
"completions/mean_length": 209.580078125,
"completions/mean_terminated_length": 177.81344757080078,
"completions/min_length": 62.3,
"completions/min_terminated_length": 62.3,
"entropy": 0.0979027939029038,
"epoch": 3.4475374732334045,
"frac_reward_zero_std": 0.76875,
"grad_norm": 0.3515625,
"learning_rate": 9.8391e-06,
"loss": -0.0213,
"num_tokens": 183329631.0,
"reward": 1.0320508122444152,
"reward_std": 0.22886947467923163,
"rewards/reward_accuracy/mean": 0.93359375,
"rewards/reward_accuracy/std": 0.22405001148581505,
"rewards/reward_format/mean": 0.09845703318715096,
"rewards/reward_format/std": 0.009517570538446308,
"sampling/importance_sampling_ratio/max": 2.2076767683029175,
"sampling/importance_sampling_ratio/mean": 0.9682565569877625,
"sampling/importance_sampling_ratio/min": 0.10232938155531883,
"sampling/sampling_logp_difference/max": 1.0734796166419982,
"sampling/sampling_logp_difference/mean": 0.005225560092367232,
"step": 1610,
"step_time": 8.40665746848099
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.020703125,
"completions/max_length": 1904.1,
"completions/max_terminated_length": 1836.8,
"completions/mean_length": 247.462109375,
"completions/mean_terminated_length": 209.68619384765626,
"completions/min_length": 71.5,
"completions/min_terminated_length": 71.5,
"entropy": 0.12288668649271131,
"epoch": 3.468950749464668,
"frac_reward_zero_std": 0.71875,
"grad_norm": 0.7109375,
"learning_rate": 9.8381e-06,
"loss": -0.0264,
"num_tokens": 184481502.0,
"reward": 1.0083789348602294,
"reward_std": 0.2701792851090431,
"rewards/reward_accuracy/mean": 0.91015625,
"rewards/reward_accuracy/std": 0.2654023960232735,
"rewards/reward_format/mean": 0.09822265803813934,
"rewards/reward_format/std": 0.01067848310340196,
"sampling/importance_sampling_ratio/max": 2.47910498380661,
"sampling/importance_sampling_ratio/mean": 0.9638559877872467,
"sampling/importance_sampling_ratio/min": 0.07256823033094406,
"sampling/sampling_logp_difference/max": 1.200941550731659,
"sampling/sampling_logp_difference/mean": 0.006082874815911054,
"step": 1620,
"step_time": 9.52988305259496
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.023046875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1788.1,
"completions/mean_length": 262.738671875,
"completions/mean_terminated_length": 220.87830810546876,
"completions/min_length": 69.7,
"completions/min_terminated_length": 69.7,
"entropy": 0.11522620865143836,
"epoch": 3.4903640256959316,
"frac_reward_zero_std": 0.69375,
"grad_norm": 0.62890625,
"learning_rate": 9.837100000000001e-06,
"loss": -0.0142,
"num_tokens": 185674657.0,
"reward": 0.9814258098602295,
"reward_std": 0.3122294768691063,
"rewards/reward_accuracy/mean": 0.88359375,
"rewards/reward_accuracy/std": 0.3068507194519043,
"rewards/reward_format/mean": 0.09783203303813934,
"rewards/reward_format/std": 0.01296319612301886,
"sampling/importance_sampling_ratio/max": 2.493324565887451,
"sampling/importance_sampling_ratio/mean": 0.9618468225002289,
"sampling/importance_sampling_ratio/min": 0.04118923675268889,
"sampling/sampling_logp_difference/max": 1.0024495482444764,
"sampling/sampling_logp_difference/mean": 0.005847154883667827,
"step": 1630,
"step_time": 10.290614356845618
},
{
"clip_ratio/high_max": 1.772575851646252e-05,
"clip_ratio/high_mean": 2.215719814557815e-06,
"clip_ratio/low_mean": 2.1433470465126447e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.4300546101585495e-06,
"completions/clipped_ratio": 0.020703125,
"completions/max_length": 1994.6,
"completions/max_terminated_length": 1857.4,
"completions/mean_length": 238.71796875,
"completions/mean_terminated_length": 200.68575592041014,
"completions/min_length": 62.7,
"completions/min_terminated_length": 62.7,
"entropy": 0.10860983827151358,
"epoch": 3.5117773019271947,
"frac_reward_zero_std": 0.71875,
"grad_norm": 0.40234375,
"learning_rate": 9.8361e-06,
"loss": -0.0099,
"num_tokens": 186819455.0,
"reward": 0.9915234625339509,
"reward_std": 0.3036754630506039,
"rewards/reward_accuracy/mean": 0.893359375,
"rewards/reward_accuracy/std": 0.2991088829934597,
"rewards/reward_format/mean": 0.09816406220197678,
"rewards/reward_format/std": 0.011167981196194887,
"sampling/importance_sampling_ratio/max": 2.520857095718384,
"sampling/importance_sampling_ratio/mean": 0.9821114957332611,
"sampling/importance_sampling_ratio/min": 0.051760608702898024,
"sampling/sampling_logp_difference/max": 1.2780590415000916,
"sampling/sampling_logp_difference/mean": 0.005809213407337666,
"step": 1640,
"step_time": 9.982548136357218
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.020703125,
"completions/max_length": 1949.6,
"completions/max_terminated_length": 1662.7,
"completions/mean_length": 211.445703125,
"completions/mean_terminated_length": 172.9366424560547,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.10030085560865701,
"epoch": 3.5331905781584583,
"frac_reward_zero_std": 0.7375,
"grad_norm": 0.283203125,
"learning_rate": 9.8351e-06,
"loss": -0.0105,
"num_tokens": 187873844.0,
"reward": 0.9687500357627868,
"reward_std": 0.3284193605184555,
"rewards/reward_accuracy/mean": 0.8703125,
"rewards/reward_accuracy/std": 0.32416985034942625,
"rewards/reward_format/mean": 0.09843750149011612,
"rewards/reward_format/std": 0.009891503863036633,
"sampling/importance_sampling_ratio/max": 2.253275918960571,
"sampling/importance_sampling_ratio/mean": 0.9664777278900146,
"sampling/importance_sampling_ratio/min": 0.07668975191190838,
"sampling/sampling_logp_difference/max": 0.9255901575088501,
"sampling/sampling_logp_difference/mean": 0.005400490202009678,
"step": 1650,
"step_time": 9.473287948127837
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 1877.7,
"completions/max_terminated_length": 1757.8,
"completions/mean_length": 226.249609375,
"completions/mean_terminated_length": 197.42579040527343,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.10110052381642162,
"epoch": 3.554603854389722,
"frac_reward_zero_std": 0.7375,
"grad_norm": 0.72265625,
"learning_rate": 9.834100000000001e-06,
"loss": -0.0212,
"num_tokens": 188974899.0,
"reward": 0.9907812893390655,
"reward_std": 0.2877808451652527,
"rewards/reward_accuracy/mean": 0.8921875,
"rewards/reward_accuracy/std": 0.2838792473077774,
"rewards/reward_format/mean": 0.09859375357627868,
"rewards/reward_format/std": 0.008432799251750112,
"sampling/importance_sampling_ratio/max": 2.47471569776535,
"sampling/importance_sampling_ratio/mean": 0.9611785471439361,
"sampling/importance_sampling_ratio/min": 0.06101883947849274,
"sampling/sampling_logp_difference/max": 0.8893118739128113,
"sampling/sampling_logp_difference/mean": 0.0053564908914268015,
"step": 1660,
"step_time": 9.426614956045523
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0140625,
"completions/max_length": 2046.4,
"completions/max_terminated_length": 1834.2,
"completions/mean_length": 220.980859375,
"completions/mean_terminated_length": 195.13493957519532,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.1080634981393814,
"epoch": 3.576017130620985,
"frac_reward_zero_std": 0.6625,
"grad_norm": 0.8203125,
"learning_rate": 9.8331e-06,
"loss": -0.0116,
"num_tokens": 190055938.0,
"reward": 0.9839257776737214,
"reward_std": 0.3154565304517746,
"rewards/reward_accuracy/mean": 0.88515625,
"rewards/reward_accuracy/std": 0.31254030764102936,
"rewards/reward_format/mean": 0.09876953139901161,
"rewards/reward_format/std": 0.008811962092295289,
"sampling/importance_sampling_ratio/max": 2.696511244773865,
"sampling/importance_sampling_ratio/mean": 0.9784788846969604,
"sampling/importance_sampling_ratio/min": 0.008884686976671219,
"sampling/sampling_logp_difference/max": 0.9039331793785095,
"sampling/sampling_logp_difference/mean": 0.0058371934574097395,
"step": 1670,
"step_time": 9.733733983943239
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.014453125,
"completions/max_length": 1852.2,
"completions/max_terminated_length": 1732.8,
"completions/mean_length": 231.48046875,
"completions/mean_terminated_length": 205.1640411376953,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.10511073009110987,
"epoch": 3.5974304068522485,
"frac_reward_zero_std": 0.6875,
"grad_norm": 0.455078125,
"learning_rate": 9.8321e-06,
"loss": -0.0182,
"num_tokens": 191162576.0,
"reward": 0.9875976860523223,
"reward_std": 0.2910879023373127,
"rewards/reward_accuracy/mean": 0.8890625,
"rewards/reward_accuracy/std": 0.2874550513923168,
"rewards/reward_format/mean": 0.09853515923023223,
"rewards/reward_format/std": 0.00960803241468966,
"sampling/importance_sampling_ratio/max": 2.5216283917427065,
"sampling/importance_sampling_ratio/mean": 0.9725351929664612,
"sampling/importance_sampling_ratio/min": 0.07817720714956522,
"sampling/sampling_logp_difference/max": 0.8510629057884216,
"sampling/sampling_logp_difference/mean": 0.005632062116637826,
"step": 1680,
"step_time": 9.001830588281155
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01328125,
"completions/max_length": 1968.7,
"completions/max_terminated_length": 1864.4,
"completions/mean_length": 232.5203125,
"completions/mean_terminated_length": 208.28863983154298,
"completions/min_length": 74.6,
"completions/min_terminated_length": 74.6,
"entropy": 0.1004971879068762,
"epoch": 3.6188436830835116,
"frac_reward_zero_std": 0.73125,
"grad_norm": 0.1865234375,
"learning_rate": 9.831100000000001e-06,
"loss": -0.0053,
"num_tokens": 192276404.0,
"reward": 0.995898449420929,
"reward_std": 0.28882277458906175,
"rewards/reward_accuracy/mean": 0.897265625,
"rewards/reward_accuracy/std": 0.2851711705327034,
"rewards/reward_format/mean": 0.09863281324505806,
"rewards/reward_format/std": 0.009759594686329365,
"sampling/importance_sampling_ratio/max": 2.478766071796417,
"sampling/importance_sampling_ratio/mean": 0.9721204996109009,
"sampling/importance_sampling_ratio/min": 0.046304930746555326,
"sampling/sampling_logp_difference/max": 0.7829855442047119,
"sampling/sampling_logp_difference/mean": 0.005477319285273552,
"step": 1690,
"step_time": 9.678444933658465
},
{
"clip_ratio/high_max": 1.1622501187957823e-05,
"clip_ratio/high_mean": 1.4528126484947278e-06,
"clip_ratio/low_mean": 2.567497381278372e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.0203100297731e-06,
"completions/clipped_ratio": 0.02265625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1741.0,
"completions/mean_length": 254.1328125,
"completions/mean_terminated_length": 213.17286682128906,
"completions/min_length": 78.5,
"completions/min_terminated_length": 78.5,
"entropy": 0.11597089217975735,
"epoch": 3.640256959314775,
"frac_reward_zero_std": 0.625,
"grad_norm": 0.5859375,
"learning_rate": 9.830100000000001e-06,
"loss": -0.0336,
"num_tokens": 193443384.0,
"reward": 0.9827734589576721,
"reward_std": 0.301401948928833,
"rewards/reward_accuracy/mean": 0.884765625,
"rewards/reward_accuracy/std": 0.29640525206923485,
"rewards/reward_format/mean": 0.09800781533122063,
"rewards/reward_format/std": 0.011734544625505805,
"sampling/importance_sampling_ratio/max": 2.4630356550216677,
"sampling/importance_sampling_ratio/mean": 0.9690758228302002,
"sampling/importance_sampling_ratio/min": 0.01673992071300745,
"sampling/sampling_logp_difference/max": 0.8763700604438782,
"sampling/sampling_logp_difference/mean": 0.006175266671925783,
"step": 1700,
"step_time": 9.952579493401572
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1791.3,
"completions/max_terminated_length": 1686.0,
"completions/mean_length": 222.2078125,
"completions/mean_terminated_length": 199.4939926147461,
"completions/min_length": 75.8,
"completions/min_terminated_length": 75.8,
"entropy": 0.09845844791270793,
"epoch": 3.6616702355460387,
"frac_reward_zero_std": 0.7125,
"grad_norm": 0.51171875,
"learning_rate": 9.8291e-06,
"loss": -0.0089,
"num_tokens": 194529004.0,
"reward": 1.0011328220367433,
"reward_std": 0.28615949898958204,
"rewards/reward_accuracy/mean": 0.901953125,
"rewards/reward_accuracy/std": 0.2844673037528992,
"rewards/reward_format/mean": 0.09917968809604645,
"rewards/reward_format/std": 0.00550910416059196,
"sampling/importance_sampling_ratio/max": 2.569299745559692,
"sampling/importance_sampling_ratio/mean": 0.9772696554660797,
"sampling/importance_sampling_ratio/min": 0.013084034807980061,
"sampling/sampling_logp_difference/max": 0.8750756025314331,
"sampling/sampling_logp_difference/mean": 0.005480764340609312,
"step": 1710,
"step_time": 8.808970416699594
},
{
"clip_ratio/high_max": 5.549389607040212e-06,
"clip_ratio/high_mean": 6.936737008800265e-07,
"clip_ratio/low_mean": 4.437659754330525e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.1374396763130789e-06,
"completions/clipped_ratio": 0.020703125,
"completions/max_length": 2006.0,
"completions/max_terminated_length": 1871.8,
"completions/mean_length": 264.737109375,
"completions/mean_terminated_length": 227.76506652832032,
"completions/min_length": 73.1,
"completions/min_terminated_length": 73.1,
"entropy": 0.1192632815334946,
"epoch": 3.683083511777302,
"frac_reward_zero_std": 0.68125,
"grad_norm": 0.546875,
"learning_rate": 9.8281e-06,
"loss": -0.022,
"num_tokens": 195718987.0,
"reward": 0.9873437702655792,
"reward_std": 0.29586231112480166,
"rewards/reward_accuracy/mean": 0.8890625,
"rewards/reward_accuracy/std": 0.2919920742511749,
"rewards/reward_format/mean": 0.09828124940395355,
"rewards/reward_format/std": 0.00995842816773802,
"sampling/importance_sampling_ratio/max": 2.5475821614265444,
"sampling/importance_sampling_ratio/mean": 0.9584749400615692,
"sampling/importance_sampling_ratio/min": 0.028304804116487503,
"sampling/sampling_logp_difference/max": 0.7644051730632782,
"sampling/sampling_logp_difference/mean": 0.006133856019005179,
"step": 1720,
"step_time": 9.838129657799437
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0140625,
"completions/max_length": 1963.6,
"completions/max_terminated_length": 1710.7,
"completions/mean_length": 249.2,
"completions/mean_terminated_length": 223.82755584716796,
"completions/min_length": 72.9,
"completions/min_terminated_length": 72.9,
"entropy": 0.11386121767573058,
"epoch": 3.7044967880085653,
"frac_reward_zero_std": 0.66875,
"grad_norm": 1.03125,
"learning_rate": 9.827100000000001e-06,
"loss": -0.0235,
"num_tokens": 196869691.0,
"reward": 0.9810937583446503,
"reward_std": 0.30289358645677567,
"rewards/reward_accuracy/mean": 0.882421875,
"rewards/reward_accuracy/std": 0.29957753568887713,
"rewards/reward_format/mean": 0.09867187514901161,
"rewards/reward_format/std": 0.009341790899634361,
"sampling/importance_sampling_ratio/max": 2.559754419326782,
"sampling/importance_sampling_ratio/mean": 0.9674811124801636,
"sampling/importance_sampling_ratio/min": 0.022860520984977484,
"sampling/sampling_logp_difference/max": 0.7482152163982392,
"sampling/sampling_logp_difference/mean": 0.006012728437781334,
"step": 1730,
"step_time": 9.455139746090572
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.025,
"completions/max_length": 1867.9,
"completions/max_terminated_length": 1666.1,
"completions/mean_length": 265.394921875,
"completions/mean_terminated_length": 220.2523193359375,
"completions/min_length": 70.9,
"completions/min_terminated_length": 70.9,
"entropy": 0.11293153925798834,
"epoch": 3.725910064239829,
"frac_reward_zero_std": 0.73125,
"grad_norm": 0.859375,
"learning_rate": 9.8261e-06,
"loss": -0.0143,
"num_tokens": 198068446.0,
"reward": 0.9995508193969727,
"reward_std": 0.27206835299730303,
"rewards/reward_accuracy/mean": 0.9015625,
"rewards/reward_accuracy/std": 0.266640505194664,
"rewards/reward_format/mean": 0.09798828288912773,
"rewards/reward_format/std": 0.011093414761126042,
"sampling/importance_sampling_ratio/max": 2.4889082312583923,
"sampling/importance_sampling_ratio/mean": 0.9592509806156159,
"sampling/importance_sampling_ratio/min": 0.036384567618370056,
"sampling/sampling_logp_difference/max": 1.0202884018421172,
"sampling/sampling_logp_difference/mean": 0.005841715983115137,
"step": 1740,
"step_time": 9.38538291318837
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.030078125,
"completions/max_length": 1967.5,
"completions/max_terminated_length": 1864.5,
"completions/mean_length": 301.887890625,
"completions/mean_terminated_length": 249.04328002929688,
"completions/min_length": 74.5,
"completions/min_terminated_length": 74.5,
"entropy": 0.12448770119808614,
"epoch": 3.747323340471092,
"frac_reward_zero_std": 0.6875,
"grad_norm": 0.7734375,
"learning_rate": 9.8251e-06,
"loss": -0.008,
"num_tokens": 199354575.0,
"reward": 0.9471289217472076,
"reward_std": 0.3447194129228592,
"rewards/reward_accuracy/mean": 0.85,
"rewards/reward_accuracy/std": 0.33896690756082537,
"rewards/reward_format/mean": 0.09712890833616257,
"rewards/reward_format/std": 0.012860493338666856,
"sampling/importance_sampling_ratio/max": 2.5905746459960937,
"sampling/importance_sampling_ratio/mean": 0.9642947614192963,
"sampling/importance_sampling_ratio/min": 0.03375800382345915,
"sampling/sampling_logp_difference/max": 0.7228492796421051,
"sampling/sampling_logp_difference/mean": 0.006165919033810497,
"step": 1750,
"step_time": 9.808216288602853
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01328125,
"completions/max_length": 1862.1,
"completions/max_terminated_length": 1709.5,
"completions/mean_length": 252.04765625,
"completions/mean_terminated_length": 228.34712677001954,
"completions/min_length": 73.5,
"completions/min_terminated_length": 73.5,
"entropy": 0.11447537722997367,
"epoch": 3.7687366167023555,
"frac_reward_zero_std": 0.66875,
"grad_norm": 0.5546875,
"learning_rate": 9.824100000000001e-06,
"loss": -0.0199,
"num_tokens": 200516633.0,
"reward": 0.9760937809944152,
"reward_std": 0.3248265966773033,
"rewards/reward_accuracy/mean": 0.87734375,
"rewards/reward_accuracy/std": 0.32196573317050936,
"rewards/reward_format/mean": 0.09875000193715096,
"rewards/reward_format/std": 0.008399902563542127,
"sampling/importance_sampling_ratio/max": 2.4378129720687864,
"sampling/importance_sampling_ratio/mean": 0.9605781078338623,
"sampling/importance_sampling_ratio/min": 0.008784640580415726,
"sampling/sampling_logp_difference/max": 0.8614825785160065,
"sampling/sampling_logp_difference/mean": 0.005908358190208673,
"step": 1760,
"step_time": 9.034472907304007
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015234375,
"completions/max_length": 1906.2,
"completions/max_terminated_length": 1692.9,
"completions/mean_length": 245.54296875,
"completions/mean_terminated_length": 218.06744689941405,
"completions/min_length": 75.1,
"completions/min_terminated_length": 75.1,
"entropy": 0.11025548554025591,
"epoch": 3.790149892933619,
"frac_reward_zero_std": 0.6375,
"grad_norm": 0.58203125,
"learning_rate": 9.823100000000001e-06,
"loss": -0.0173,
"num_tokens": 201667991.0,
"reward": 0.9788476824760437,
"reward_std": 0.3138418808579445,
"rewards/reward_accuracy/mean": 0.880078125,
"rewards/reward_accuracy/std": 0.310952752828598,
"rewards/reward_format/mean": 0.09876953288912774,
"rewards/reward_format/std": 0.007607561489567161,
"sampling/importance_sampling_ratio/max": 2.65124888420105,
"sampling/importance_sampling_ratio/mean": 0.9717750489711762,
"sampling/importance_sampling_ratio/min": 0.03252590596675873,
"sampling/sampling_logp_difference/max": 0.9282626986503602,
"sampling/sampling_logp_difference/mean": 0.00601572822779417,
"step": 1770,
"step_time": 9.32412418590393
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 1639.6,
"completions/max_terminated_length": 1541.3,
"completions/mean_length": 238.39453125,
"completions/mean_terminated_length": 217.2953842163086,
"completions/min_length": 82.3,
"completions/min_terminated_length": 82.3,
"entropy": 0.11045554294250906,
"epoch": 3.811563169164882,
"frac_reward_zero_std": 0.725,
"grad_norm": 0.546875,
"learning_rate": 9.8221e-06,
"loss": -0.0066,
"num_tokens": 202800457.0,
"reward": 0.9771093904972077,
"reward_std": 0.3061934158205986,
"rewards/reward_accuracy/mean": 0.878125,
"rewards/reward_accuracy/std": 0.30397213697433473,
"rewards/reward_format/mean": 0.0989843763411045,
"rewards/reward_format/std": 0.006647321698255837,
"sampling/importance_sampling_ratio/max": 2.322800540924072,
"sampling/importance_sampling_ratio/mean": 0.9712456941604615,
"sampling/importance_sampling_ratio/min": 0.03877677023410797,
"sampling/sampling_logp_difference/max": 0.8283046305179596,
"sampling/sampling_logp_difference/mean": 0.005930081801488995,
"step": 1780,
"step_time": 7.867096417295397
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012890625,
"completions/max_length": 1866.0,
"completions/max_terminated_length": 1733.8,
"completions/mean_length": 244.66640625,
"completions/mean_terminated_length": 221.41945037841796,
"completions/min_length": 74.4,
"completions/min_terminated_length": 74.4,
"entropy": 0.10171096110716463,
"epoch": 3.8329764453961457,
"frac_reward_zero_std": 0.74375,
"grad_norm": 0.6953125,
"learning_rate": 9.821100000000002e-06,
"loss": -0.0164,
"num_tokens": 203947891.0,
"reward": 0.9703515708446503,
"reward_std": 0.32166723236441613,
"rewards/reward_accuracy/mean": 0.871484375,
"rewards/reward_accuracy/std": 0.3188847117125988,
"rewards/reward_format/mean": 0.09886718615889549,
"rewards/reward_format/std": 0.007744115893729031,
"sampling/importance_sampling_ratio/max": 2.4952943682670594,
"sampling/importance_sampling_ratio/mean": 0.9810825884342194,
"sampling/importance_sampling_ratio/min": 0.00613432489335537,
"sampling/sampling_logp_difference/max": 0.860816490650177,
"sampling/sampling_logp_difference/mean": 0.00535674411803484,
"step": 1790,
"step_time": 9.080039828596636
},
{
"clip_ratio/high_max": 8.538251131540165e-06,
"clip_ratio/high_mean": 1.0672813914425206e-06,
"clip_ratio/low_mean": 1.6258911273325793e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.6931725187751e-06,
"completions/clipped_ratio": 0.01328125,
"completions/max_length": 1968.8,
"completions/max_terminated_length": 1717.1,
"completions/mean_length": 247.351171875,
"completions/mean_terminated_length": 223.46299438476564,
"completions/min_length": 73.0,
"completions/min_terminated_length": 73.0,
"entropy": 0.11017707744613289,
"epoch": 3.854389721627409,
"frac_reward_zero_std": 0.7125,
"grad_norm": 0.6015625,
"learning_rate": 9.820100000000001e-06,
"loss": -0.0105,
"num_tokens": 205104006.0,
"reward": 0.979589867591858,
"reward_std": 0.29133337214589117,
"rewards/reward_accuracy/mean": 0.880859375,
"rewards/reward_accuracy/std": 0.2886448673903942,
"rewards/reward_format/mean": 0.09873047098517418,
"rewards/reward_format/std": 0.008285083319060504,
"sampling/importance_sampling_ratio/max": 2.5239701509475707,
"sampling/importance_sampling_ratio/mean": 0.9769951224327087,
"sampling/importance_sampling_ratio/min": 0.03258771002292633,
"sampling/sampling_logp_difference/max": 1.09389631152153,
"sampling/sampling_logp_difference/mean": 0.005795456771738827,
"step": 1800,
"step_time": 9.605937331699533
},
{
"clip_ratio/high_max": 1.5936254931148143e-05,
"clip_ratio/high_mean": 1.992031866393518e-06,
"clip_ratio/low_mean": 8.232349500758574e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.815266816469375e-06,
"completions/clipped_ratio": 0.01875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1775.6,
"completions/mean_length": 271.60625,
"completions/mean_terminated_length": 237.91127166748046,
"completions/min_length": 76.8,
"completions/min_terminated_length": 76.8,
"entropy": 0.11645387229509652,
"epoch": 3.8758029978586723,
"frac_reward_zero_std": 0.675,
"grad_norm": 0.41015625,
"learning_rate": 9.8191e-06,
"loss": -0.0073,
"num_tokens": 206311414.0,
"reward": 0.9786132991313934,
"reward_std": 0.31219071000814436,
"rewards/reward_accuracy/mean": 0.88046875,
"rewards/reward_accuracy/std": 0.30729184225201606,
"rewards/reward_format/mean": 0.09814453199505806,
"rewards/reward_format/std": 0.011364398919977248,
"sampling/importance_sampling_ratio/max": 2.5752052545547484,
"sampling/importance_sampling_ratio/mean": 0.9654738962650299,
"sampling/importance_sampling_ratio/min": 0.009438053891062736,
"sampling/sampling_logp_difference/max": 1.0431099653244018,
"sampling/sampling_logp_difference/mean": 0.005761270644143224,
"step": 1810,
"step_time": 10.163690623601724
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.014453125,
"completions/max_length": 1890.2,
"completions/max_terminated_length": 1649.3,
"completions/mean_length": 251.666796875,
"completions/mean_terminated_length": 225.85834350585938,
"completions/min_length": 81.1,
"completions/min_terminated_length": 81.1,
"entropy": 0.11131578809581696,
"epoch": 3.897216274089936,
"frac_reward_zero_std": 0.7125,
"grad_norm": 0.60546875,
"learning_rate": 9.8181e-06,
"loss": -0.0163,
"num_tokens": 207470353.0,
"reward": 0.9910742580890656,
"reward_std": 0.28269105702638625,
"rewards/reward_accuracy/mean": 0.892578125,
"rewards/reward_accuracy/std": 0.2787009343504906,
"rewards/reward_format/mean": 0.09849609583616256,
"rewards/reward_format/std": 0.009461269760504366,
"sampling/importance_sampling_ratio/max": 2.4869394183158873,
"sampling/importance_sampling_ratio/mean": 0.9642408311367034,
"sampling/importance_sampling_ratio/min": 0.02942931729485281,
"sampling/sampling_logp_difference/max": 1.1633307695388795,
"sampling/sampling_logp_difference/mean": 0.005645580496639014,
"step": 1820,
"step_time": 9.523036262800451
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1975.8,
"completions/max_terminated_length": 1720.4,
"completions/mean_length": 230.91640625,
"completions/mean_terminated_length": 214.46705780029296,
"completions/min_length": 73.5,
"completions/min_terminated_length": 73.5,
"entropy": 0.10626117531210184,
"epoch": 3.9186295503211994,
"frac_reward_zero_std": 0.71875,
"grad_norm": 0.50390625,
"learning_rate": 9.817100000000001e-06,
"loss": -0.0249,
"num_tokens": 208577307.0,
"reward": 0.9772851824760437,
"reward_std": 0.3229082882404327,
"rewards/reward_accuracy/mean": 0.878125,
"rewards/reward_accuracy/std": 0.3208357244729996,
"rewards/reward_format/mean": 0.09916015863418579,
"rewards/reward_format/std": 0.006904154294170439,
"sampling/importance_sampling_ratio/max": 2.5039249420166017,
"sampling/importance_sampling_ratio/mean": 0.9700947165489197,
"sampling/importance_sampling_ratio/min": 0.05878835800103843,
"sampling/sampling_logp_difference/max": 0.7347710490226745,
"sampling/sampling_logp_difference/mean": 0.005494658090174198,
"step": 1830,
"step_time": 9.511407239902473
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 5.773138582298998e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 5.773138582298998e-07,
"completions/clipped_ratio": 0.01953125,
"completions/max_length": 1815.9,
"completions/max_terminated_length": 1565.1,
"completions/mean_length": 235.851953125,
"completions/mean_terminated_length": 200.36127014160155,
"completions/min_length": 73.4,
"completions/min_terminated_length": 73.4,
"entropy": 0.09902307828888297,
"epoch": 3.9400428265524625,
"frac_reward_zero_std": 0.7375,
"grad_norm": 0.44921875,
"learning_rate": 9.8161e-06,
"loss": -0.018,
"num_tokens": 209695744.0,
"reward": 0.9996289432048797,
"reward_std": 0.2805600747466087,
"rewards/reward_accuracy/mean": 0.901171875,
"rewards/reward_accuracy/std": 0.27641231939196587,
"rewards/reward_format/mean": 0.09845703318715096,
"rewards/reward_format/std": 0.009629160887561739,
"sampling/importance_sampling_ratio/max": 2.5333241701126097,
"sampling/importance_sampling_ratio/mean": 0.9753164827823639,
"sampling/importance_sampling_ratio/min": 0.026690761744976043,
"sampling/sampling_logp_difference/max": 0.7702405095100403,
"sampling/sampling_logp_difference/mean": 0.0054461341351270676,
"step": 1840,
"step_time": 8.965677818401309
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.025390625,
"completions/max_length": 1935.9,
"completions/max_terminated_length": 1762.7,
"completions/mean_length": 293.9609375,
"completions/mean_terminated_length": 248.87220001220703,
"completions/min_length": 72.3,
"completions/min_terminated_length": 72.3,
"entropy": 0.12396332090720534,
"epoch": 3.961456102783726,
"frac_reward_zero_std": 0.625,
"grad_norm": 0.302734375,
"learning_rate": 9.8151e-06,
"loss": -0.0167,
"num_tokens": 210969356.0,
"reward": 0.9753125309944153,
"reward_std": 0.3194266900420189,
"rewards/reward_accuracy/mean": 0.877734375,
"rewards/reward_accuracy/std": 0.31349882781505584,
"rewards/reward_format/mean": 0.09757812768220901,
"rewards/reward_format/std": 0.011822100728750229,
"sampling/importance_sampling_ratio/max": 2.5180176734924316,
"sampling/importance_sampling_ratio/mean": 0.955813217163086,
"sampling/importance_sampling_ratio/min": 0.008985464088618755,
"sampling/sampling_logp_difference/max": 1.2890136003494264,
"sampling/sampling_logp_difference/mean": 0.006074676895514131,
"step": 1850,
"step_time": 10.045911873890145
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0140625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1723.6,
"completions/mean_length": 252.4609375,
"completions/mean_terminated_length": 226.94437408447266,
"completions/min_length": 77.5,
"completions/min_terminated_length": 77.5,
"entropy": 0.11219770573079586,
"epoch": 3.982869379014989,
"frac_reward_zero_std": 0.65625,
"grad_norm": 0.33203125,
"learning_rate": 9.814100000000001e-06,
"loss": -0.0174,
"num_tokens": 212133784.0,
"reward": 0.9757031381130219,
"reward_std": 0.32375199198722837,
"rewards/reward_accuracy/mean": 0.876953125,
"rewards/reward_accuracy/std": 0.3206891596317291,
"rewards/reward_format/mean": 0.09875000044703483,
"rewards/reward_format/std": 0.008781819907017051,
"sampling/importance_sampling_ratio/max": 2.5389029741287232,
"sampling/importance_sampling_ratio/mean": 0.9652904570102692,
"sampling/importance_sampling_ratio/min": 0.014686112711206078,
"sampling/sampling_logp_difference/max": 0.7811557173728942,
"sampling/sampling_logp_difference/mean": 0.005962699931114912,
"step": 1860,
"step_time": 10.19707946030394
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1747.7,
"completions/max_terminated_length": 1661.1,
"completions/mean_length": 219.98671875,
"completions/mean_terminated_length": 205.8608184814453,
"completions/min_length": 73.4,
"completions/min_terminated_length": 73.4,
"entropy": 0.09815784357488155,
"epoch": 4.004282655246253,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.33984375,
"learning_rate": 9.813100000000001e-06,
"loss": -0.0078,
"num_tokens": 213209942.0,
"reward": 1.0116796910762786,
"reward_std": 0.26402966156601904,
"rewards/reward_accuracy/mean": 0.9125,
"rewards/reward_accuracy/std": 0.26204313039779664,
"rewards/reward_format/mean": 0.09917968809604645,
"rewards/reward_format/std": 0.006832579686306417,
"sampling/importance_sampling_ratio/max": 2.496462082862854,
"sampling/importance_sampling_ratio/mean": 0.9874454438686371,
"sampling/importance_sampling_ratio/min": 0.10873651299625635,
"sampling/sampling_logp_difference/max": 0.6832794487476349,
"sampling/sampling_logp_difference/mean": 0.00513655215036124,
"step": 1870,
"step_time": 8.520473426789977
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1719.4,
"completions/max_terminated_length": 1557.9,
"completions/mean_length": 232.39296875,
"completions/mean_terminated_length": 215.67175903320313,
"completions/min_length": 78.9,
"completions/min_terminated_length": 78.9,
"entropy": 0.10906876525841654,
"epoch": 4.025695931477516,
"frac_reward_zero_std": 0.74375,
"grad_norm": 0.59375,
"learning_rate": 9.8121e-06,
"loss": -0.0152,
"num_tokens": 214323716.0,
"reward": 1.0147265672683716,
"reward_std": 0.25953788459300997,
"rewards/reward_accuracy/mean": 0.915625,
"rewards/reward_accuracy/std": 0.25727768540382384,
"rewards/reward_format/mean": 0.09910156428813935,
"rewards/reward_format/std": 0.006137685454450548,
"sampling/importance_sampling_ratio/max": 2.489317762851715,
"sampling/importance_sampling_ratio/mean": 0.9758122146129609,
"sampling/importance_sampling_ratio/min": 0.040069063752889635,
"sampling/sampling_logp_difference/max": 0.9777339220046997,
"sampling/sampling_logp_difference/mean": 0.005648333160206675,
"step": 1880,
"step_time": 8.415918162200251
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 1887.1,
"completions/max_terminated_length": 1672.1,
"completions/mean_length": 222.43515625,
"completions/mean_terminated_length": 201.05305023193358,
"completions/min_length": 67.3,
"completions/min_terminated_length": 67.3,
"entropy": 0.10548757310025395,
"epoch": 4.04710920770878,
"frac_reward_zero_std": 0.73125,
"grad_norm": 0.91796875,
"learning_rate": 9.811100000000002e-06,
"loss": -0.0046,
"num_tokens": 215411662.0,
"reward": 0.9950000286102295,
"reward_std": 0.30058709979057313,
"rewards/reward_accuracy/mean": 0.89609375,
"rewards/reward_accuracy/std": 0.2976105585694313,
"rewards/reward_format/mean": 0.09890625104308129,
"rewards/reward_format/std": 0.008095170860178769,
"sampling/importance_sampling_ratio/max": 2.5164835691452025,
"sampling/importance_sampling_ratio/mean": 0.9656373500823975,
"sampling/importance_sampling_ratio/min": 0.043292487412691115,
"sampling/sampling_logp_difference/max": 0.8752450823783875,
"sampling/sampling_logp_difference/mean": 0.005420983489602804,
"step": 1890,
"step_time": 9.123994514197694
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.3032134777167812e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.3032134777167812e-07,
"completions/clipped_ratio": 0.02109375,
"completions/max_length": 1898.7,
"completions/max_terminated_length": 1729.5,
"completions/mean_length": 237.16953125,
"completions/mean_terminated_length": 198.5504608154297,
"completions/min_length": 70.0,
"completions/min_terminated_length": 70.0,
"entropy": 0.10724446275271475,
"epoch": 4.0685224839400425,
"frac_reward_zero_std": 0.725,
"grad_norm": 0.64453125,
"learning_rate": 9.810100000000001e-06,
"loss": -0.0083,
"num_tokens": 216536064.0,
"reward": 0.9913086116313934,
"reward_std": 0.2889810040593147,
"rewards/reward_accuracy/mean": 0.893359375,
"rewards/reward_accuracy/std": 0.28374333679676056,
"rewards/reward_format/mean": 0.09794922098517418,
"rewards/reward_format/std": 0.011340980930253864,
"sampling/importance_sampling_ratio/max": 2.389233577251434,
"sampling/importance_sampling_ratio/mean": 0.96959188580513,
"sampling/importance_sampling_ratio/min": 0.02555187903344631,
"sampling/sampling_logp_difference/max": 0.9271704316139221,
"sampling/sampling_logp_difference/mean": 0.0057214830536395315,
"step": 1900,
"step_time": 9.417412229807814
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1782.8,
"completions/max_terminated_length": 1576.2,
"completions/mean_length": 197.21875,
"completions/mean_terminated_length": 187.84966278076172,
"completions/min_length": 71.1,
"completions/min_terminated_length": 71.1,
"entropy": 0.08476681234315038,
"epoch": 4.089935760171306,
"frac_reward_zero_std": 0.76875,
"grad_norm": 0.205078125,
"learning_rate": 9.8091e-06,
"loss": -0.0159,
"num_tokens": 217566080.0,
"reward": 1.0196875154972076,
"reward_std": 0.2644562005996704,
"rewards/reward_accuracy/mean": 0.9203125,
"rewards/reward_accuracy/std": 0.2622656233608723,
"rewards/reward_format/mean": 0.09937499985098838,
"rewards/reward_format/std": 0.005482074641622603,
"sampling/importance_sampling_ratio/max": 2.3811018466949463,
"sampling/importance_sampling_ratio/mean": 0.9870140850543976,
"sampling/importance_sampling_ratio/min": 0.045569803565740585,
"sampling/sampling_logp_difference/max": 0.8002467274665832,
"sampling/sampling_logp_difference/mean": 0.005051636975258589,
"step": 1910,
"step_time": 8.620807183200668
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01953125,
"completions/max_length": 1922.7,
"completions/max_terminated_length": 1728.1,
"completions/mean_length": 244.520703125,
"completions/mean_terminated_length": 209.23623046875,
"completions/min_length": 71.7,
"completions/min_terminated_length": 71.7,
"entropy": 0.11389463995583356,
"epoch": 4.1113490364025695,
"frac_reward_zero_std": 0.7,
"grad_norm": 0.451171875,
"learning_rate": 9.8081e-06,
"loss": -0.0109,
"num_tokens": 218710197.0,
"reward": 0.9798828303813935,
"reward_std": 0.30734221637248993,
"rewards/reward_accuracy/mean": 0.881640625,
"rewards/reward_accuracy/std": 0.302875517308712,
"rewards/reward_format/mean": 0.09824218824505807,
"rewards/reward_format/std": 0.009994025947526098,
"sampling/importance_sampling_ratio/max": 2.3742379903793336,
"sampling/importance_sampling_ratio/mean": 0.9657935559749603,
"sampling/importance_sampling_ratio/min": 0.01778179034590721,
"sampling/sampling_logp_difference/max": 0.9001268565654754,
"sampling/sampling_logp_difference/mean": 0.005742790456861257,
"step": 1920,
"step_time": 9.559222627400596
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01640625,
"completions/max_length": 1822.4,
"completions/max_terminated_length": 1631.3,
"completions/mean_length": 226.91484375,
"completions/mean_terminated_length": 196.63839874267578,
"completions/min_length": 69.7,
"completions/min_terminated_length": 69.7,
"entropy": 0.10549103859812022,
"epoch": 4.132762312633833,
"frac_reward_zero_std": 0.7375,
"grad_norm": 1.0078125,
"learning_rate": 9.8071e-06,
"loss": -0.009,
"num_tokens": 219811723.0,
"reward": 0.977929699420929,
"reward_std": 0.3237276762723923,
"rewards/reward_accuracy/mean": 0.87890625,
"rewards/reward_accuracy/std": 0.3208704799413681,
"rewards/reward_format/mean": 0.0990234375,
"rewards/reward_format/std": 0.00765816664788872,
"sampling/importance_sampling_ratio/max": 2.618200182914734,
"sampling/importance_sampling_ratio/mean": 0.9718908846378327,
"sampling/importance_sampling_ratio/min": 0.06410768628120422,
"sampling/sampling_logp_difference/max": 0.7361603021621704,
"sampling/sampling_logp_difference/mean": 0.005618560872972011,
"step": 1930,
"step_time": 8.861281216896895
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01328125,
"completions/max_length": 1768.8,
"completions/max_terminated_length": 1520.5,
"completions/mean_length": 205.689453125,
"completions/mean_terminated_length": 181.49798736572265,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.09384390139020979,
"epoch": 4.154175588865097,
"frac_reward_zero_std": 0.7625,
"grad_norm": 0.91015625,
"learning_rate": 9.806100000000001e-06,
"loss": -0.0055,
"num_tokens": 220855056.0,
"reward": 0.9977734625339508,
"reward_std": 0.29088087379932404,
"rewards/reward_accuracy/mean": 0.898828125,
"rewards/reward_accuracy/std": 0.2881721451878548,
"rewards/reward_format/mean": 0.09894531369209289,
"rewards/reward_format/std": 0.007076422707177699,
"sampling/importance_sampling_ratio/max": 2.5909575700759886,
"sampling/importance_sampling_ratio/mean": 0.9767070412635803,
"sampling/importance_sampling_ratio/min": 0.03262447947636247,
"sampling/sampling_logp_difference/max": 0.8086506962776184,
"sampling/sampling_logp_difference/mean": 0.005275146383792162,
"step": 1940,
"step_time": 8.556375121601741
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0171875,
"completions/max_length": 1944.4,
"completions/max_terminated_length": 1872.6,
"completions/mean_length": 225.863671875,
"completions/mean_terminated_length": 194.26087188720703,
"completions/min_length": 62.6,
"completions/min_terminated_length": 62.6,
"entropy": 0.10960233323276043,
"epoch": 4.17558886509636,
"frac_reward_zero_std": 0.70625,
"grad_norm": 0.40625,
"learning_rate": 9.8051e-06,
"loss": -0.0162,
"num_tokens": 221948595.0,
"reward": 0.986308616399765,
"reward_std": 0.3119990587234497,
"rewards/reward_accuracy/mean": 0.8875,
"rewards/reward_accuracy/std": 0.30899005830287934,
"rewards/reward_format/mean": 0.09880859553813934,
"rewards/reward_format/std": 0.0077432987047359346,
"sampling/importance_sampling_ratio/max": 2.4949870824813845,
"sampling/importance_sampling_ratio/mean": 0.9676478505134583,
"sampling/importance_sampling_ratio/min": 0.03665950985159725,
"sampling/sampling_logp_difference/max": 0.9254366636276246,
"sampling/sampling_logp_difference/mean": 0.0056891322135925295,
"step": 1950,
"step_time": 9.668975406796381
},
{
"clip_ratio/high_max": 2.8964230477868113e-05,
"clip_ratio/high_mean": 3.620528809733514e-06,
"clip_ratio/low_mean": 1.3219513448348152e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.942480131830962e-06,
"completions/clipped_ratio": 0.012109375,
"completions/max_length": 1556.6,
"completions/max_terminated_length": 1303.7,
"completions/mean_length": 178.872265625,
"completions/mean_terminated_length": 156.11085510253906,
"completions/min_length": 60.6,
"completions/min_terminated_length": 60.6,
"entropy": 0.08013722794130444,
"epoch": 4.197002141327623,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.53125,
"learning_rate": 9.804100000000002e-06,
"loss": -0.0103,
"num_tokens": 222916204.0,
"reward": 1.028085958957672,
"reward_std": 0.24472709968686104,
"rewards/reward_accuracy/mean": 0.92890625,
"rewards/reward_accuracy/std": 0.24200901314616202,
"rewards/reward_format/mean": 0.09917968958616256,
"rewards/reward_format/std": 0.0055103011196479205,
"sampling/importance_sampling_ratio/max": 2.2688790798187255,
"sampling/importance_sampling_ratio/mean": 0.9798744440078735,
"sampling/importance_sampling_ratio/min": 0.1344377689063549,
"sampling/sampling_logp_difference/max": 0.8225985288619995,
"sampling/sampling_logp_difference/mean": 0.004894759715534746,
"step": 1960,
"step_time": 7.603751037498296
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1997.0,
"completions/max_terminated_length": 1857.9,
"completions/mean_length": 210.555859375,
"completions/mean_terminated_length": 190.4349136352539,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.09448540029115975,
"epoch": 4.218415417558886,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.439453125,
"learning_rate": 9.803100000000001e-06,
"loss": -0.0142,
"num_tokens": 223977595.0,
"reward": 0.9851172029972076,
"reward_std": 0.3124650329351425,
"rewards/reward_accuracy/mean": 0.8859375,
"rewards/reward_accuracy/std": 0.3100178509950638,
"rewards/reward_format/mean": 0.09917968884110451,
"rewards/reward_format/std": 0.006565603078342974,
"sampling/importance_sampling_ratio/max": 2.5055965900421144,
"sampling/importance_sampling_ratio/mean": 0.972119402885437,
"sampling/importance_sampling_ratio/min": 0.0070977487281197685,
"sampling/sampling_logp_difference/max": 1.1890580654144287,
"sampling/sampling_logp_difference/mean": 0.005356045067310333,
"step": 1970,
"step_time": 9.638867503202345
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 1930.3,
"completions/max_terminated_length": 1678.7,
"completions/mean_length": 206.833203125,
"completions/mean_terminated_length": 185.1562530517578,
"completions/min_length": 61.3,
"completions/min_terminated_length": 61.3,
"entropy": 0.09267262499779463,
"epoch": 4.23982869379015,
"frac_reward_zero_std": 0.75625,
"grad_norm": 0.38671875,
"learning_rate": 9.8021e-06,
"loss": -0.0043,
"num_tokens": 225019840.0,
"reward": 0.9973633110523223,
"reward_std": 0.29604803323745726,
"rewards/reward_accuracy/mean": 0.8984375,
"rewards/reward_accuracy/std": 0.293308761715889,
"rewards/reward_format/mean": 0.09892578348517418,
"rewards/reward_format/std": 0.007151664351113141,
"sampling/importance_sampling_ratio/max": 2.249405574798584,
"sampling/importance_sampling_ratio/mean": 0.9714468598365784,
"sampling/importance_sampling_ratio/min": 0.05552814975380897,
"sampling/sampling_logp_difference/max": 0.7853524565696717,
"sampling/sampling_logp_difference/mean": 0.005239231511950493,
"step": 1980,
"step_time": 9.492953270900761
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1855.8,
"completions/max_terminated_length": 1657.0,
"completions/mean_length": 185.832421875,
"completions/mean_terminated_length": 175.5293228149414,
"completions/min_length": 60.7,
"completions/min_terminated_length": 60.7,
"entropy": 0.08750719763338566,
"epoch": 4.2612419700214135,
"frac_reward_zero_std": 0.7,
"grad_norm": 0.97265625,
"learning_rate": 9.801100000000002e-06,
"loss": -0.0066,
"num_tokens": 226011395.0,
"reward": 1.010800802707672,
"reward_std": 0.2689823418855667,
"rewards/reward_accuracy/mean": 0.911328125,
"rewards/reward_accuracy/std": 0.2676533430814743,
"rewards/reward_format/mean": 0.0994726575911045,
"rewards/reward_format/std": 0.004226360376924277,
"sampling/importance_sampling_ratio/max": 2.5161445140838623,
"sampling/importance_sampling_ratio/mean": 0.9723219513893128,
"sampling/importance_sampling_ratio/min": 0.07100898921489715,
"sampling/sampling_logp_difference/max": 0.8597656786441803,
"sampling/sampling_logp_difference/mean": 0.005206472682766616,
"step": 1990,
"step_time": 8.722707128996262
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1850.5,
"completions/max_terminated_length": 1613.9,
"completions/mean_length": 175.6859375,
"completions/mean_terminated_length": 162.59783859252929,
"completions/min_length": 60.6,
"completions/min_terminated_length": 60.6,
"entropy": 0.08052646685391665,
"epoch": 4.282655246252677,
"frac_reward_zero_std": 0.83125,
"grad_norm": 0.65625,
"learning_rate": 9.800100000000001e-06,
"loss": -0.0102,
"num_tokens": 226964655.0,
"reward": 1.0203906536102294,
"reward_std": 0.2591245949268341,
"rewards/reward_accuracy/mean": 0.92109375,
"rewards/reward_accuracy/std": 0.2567377336323261,
"rewards/reward_format/mean": 0.09929687678813934,
"rewards/reward_format/std": 0.005810616537928581,
"sampling/importance_sampling_ratio/max": 2.5547988653182983,
"sampling/importance_sampling_ratio/mean": 0.9852603375911713,
"sampling/importance_sampling_ratio/min": 0.03428105730563402,
"sampling/sampling_logp_difference/max": 1.3333760261535645,
"sampling/sampling_logp_difference/mean": 0.005025947839021683,
"step": 2000,
"step_time": 8.903154159188853
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012109375,
"completions/max_length": 1687.4,
"completions/max_terminated_length": 1525.7,
"completions/mean_length": 209.242578125,
"completions/mean_terminated_length": 187.08142700195313,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.09399332064203918,
"epoch": 4.30406852248394,
"frac_reward_zero_std": 0.69375,
"grad_norm": 0.296875,
"learning_rate": 9.7991e-06,
"loss": -0.0196,
"num_tokens": 228020668.0,
"reward": 0.967070335149765,
"reward_std": 0.332244785130024,
"rewards/reward_accuracy/mean": 0.86796875,
"rewards/reward_accuracy/std": 0.33008057326078416,
"rewards/reward_format/mean": 0.09910156354308128,
"rewards/reward_format/std": 0.006800719466991722,
"sampling/importance_sampling_ratio/max": 2.4063852429389954,
"sampling/importance_sampling_ratio/mean": 0.9778293013572693,
"sampling/importance_sampling_ratio/min": 0.08326948881149292,
"sampling/sampling_logp_difference/max": 1.2640114843845367,
"sampling/sampling_logp_difference/mean": 0.005437909765169025,
"step": 2010,
"step_time": 8.459733507601777
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1835.9,
"completions/max_terminated_length": 1631.0,
"completions/mean_length": 197.99453125,
"completions/mean_terminated_length": 181.3332260131836,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.09036683803424239,
"epoch": 4.325481798715203,
"frac_reward_zero_std": 0.725,
"grad_norm": 0.94921875,
"learning_rate": 9.7981e-06,
"loss": -0.0137,
"num_tokens": 229040830.0,
"reward": 1.0002148568630218,
"reward_std": 0.2921817272901535,
"rewards/reward_accuracy/mean": 0.901171875,
"rewards/reward_accuracy/std": 0.2890390917658806,
"rewards/reward_format/mean": 0.09904297068715096,
"rewards/reward_format/std": 0.007983049564063548,
"sampling/importance_sampling_ratio/max": 2.3476433873176576,
"sampling/importance_sampling_ratio/mean": 0.9750633597373962,
"sampling/importance_sampling_ratio/min": 0.051548021472990514,
"sampling/sampling_logp_difference/max": 0.7461958885192871,
"sampling/sampling_logp_difference/mean": 0.005363814067095518,
"step": 2020,
"step_time": 8.786099350302539
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015234375,
"completions/max_length": 2017.1,
"completions/max_terminated_length": 1751.4,
"completions/mean_length": 218.8046875,
"completions/mean_terminated_length": 190.57720794677735,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.1022476602345705,
"epoch": 4.346895074946467,
"frac_reward_zero_std": 0.71875,
"grad_norm": 0.384765625,
"learning_rate": 9.7971e-06,
"loss": -0.0131,
"num_tokens": 230122282.0,
"reward": 0.9668554902076721,
"reward_std": 0.3360069617629051,
"rewards/reward_accuracy/mean": 0.86796875,
"rewards/reward_accuracy/std": 0.33305981308221816,
"rewards/reward_format/mean": 0.09888672232627868,
"rewards/reward_format/std": 0.00838587167672813,
"sampling/importance_sampling_ratio/max": 2.5454454898834227,
"sampling/importance_sampling_ratio/mean": 0.9800317168235779,
"sampling/importance_sampling_ratio/min": 0.04382980114314705,
"sampling/sampling_logp_difference/max": 0.8039904952049255,
"sampling/sampling_logp_difference/mean": 0.005709635838866234,
"step": 2030,
"step_time": 9.936319773294963
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1911.1,
"completions/max_terminated_length": 1686.6,
"completions/mean_length": 201.569921875,
"completions/mean_terminated_length": 181.32967834472657,
"completions/min_length": 63.9,
"completions/min_terminated_length": 63.9,
"entropy": 0.08554767444729805,
"epoch": 4.36830835117773,
"frac_reward_zero_std": 0.73125,
"grad_norm": 0.388671875,
"learning_rate": 9.796100000000001e-06,
"loss": -0.011,
"num_tokens": 231159757.0,
"reward": 0.9846289336681366,
"reward_std": 0.30987718403339387,
"rewards/reward_accuracy/mean": 0.885546875,
"rewards/reward_accuracy/std": 0.30737688541412356,
"rewards/reward_format/mean": 0.09908203557133674,
"rewards/reward_format/std": 0.00754120263736695,
"sampling/importance_sampling_ratio/max": 2.5291023731231688,
"sampling/importance_sampling_ratio/mean": 0.9788542211055755,
"sampling/importance_sampling_ratio/min": 0.02789664827287197,
"sampling/sampling_logp_difference/max": 1.0577860951423645,
"sampling/sampling_logp_difference/mean": 0.005004906468093396,
"step": 2040,
"step_time": 9.488443369492597
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1611.2,
"completions/max_terminated_length": 1379.7,
"completions/mean_length": 185.3671875,
"completions/mean_terminated_length": 173.96497497558593,
"completions/min_length": 60.1,
"completions/min_terminated_length": 60.1,
"entropy": 0.0841828775126487,
"epoch": 4.389721627408994,
"frac_reward_zero_std": 0.7,
"grad_norm": 1.03125,
"learning_rate": 9.7951e-06,
"loss": -0.0055,
"num_tokens": 232159161.0,
"reward": 0.9576758086681366,
"reward_std": 0.33522614687681196,
"rewards/reward_accuracy/mean": 0.858203125,
"rewards/reward_accuracy/std": 0.334013032913208,
"rewards/reward_format/mean": 0.0994726575911045,
"rewards/reward_format/std": 0.0045425040181726216,
"sampling/importance_sampling_ratio/max": 2.530995774269104,
"sampling/importance_sampling_ratio/mean": 0.9801888585090637,
"sampling/importance_sampling_ratio/min": 0.13382704854011535,
"sampling/sampling_logp_difference/max": 0.7100008487701416,
"sampling/sampling_logp_difference/mean": 0.00543126342818141,
"step": 2050,
"step_time": 7.591099826997379
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1647.5,
"completions/max_terminated_length": 1509.3,
"completions/mean_length": 195.51484375,
"completions/mean_terminated_length": 177.44683074951172,
"completions/min_length": 58.1,
"completions/min_terminated_length": 58.1,
"entropy": 0.09488111911341549,
"epoch": 4.4111349036402565,
"frac_reward_zero_std": 0.725,
"grad_norm": 0.6171875,
"learning_rate": 9.794100000000002e-06,
"loss": -0.0135,
"num_tokens": 233182687.0,
"reward": 0.9827343940734863,
"reward_std": 0.31327798664569856,
"rewards/reward_accuracy/mean": 0.88359375,
"rewards/reward_accuracy/std": 0.31096345782279966,
"rewards/reward_format/mean": 0.09914062768220902,
"rewards/reward_format/std": 0.006493909750133753,
"sampling/importance_sampling_ratio/max": 2.4778871893882752,
"sampling/importance_sampling_ratio/mean": 0.9793868839740754,
"sampling/importance_sampling_ratio/min": 0.06390379788354039,
"sampling/sampling_logp_difference/max": 0.8441758394241333,
"sampling/sampling_logp_difference/mean": 0.00530198854394257,
"step": 2060,
"step_time": 8.44795082360506
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1560.2,
"completions/max_terminated_length": 1474.7,
"completions/mean_length": 191.8890625,
"completions/mean_terminated_length": 175.44595336914062,
"completions/min_length": 58.4,
"completions/min_terminated_length": 58.4,
"entropy": 0.09051755731925368,
"epoch": 4.43254817987152,
"frac_reward_zero_std": 0.75625,
"grad_norm": 1.0,
"learning_rate": 9.793100000000001e-06,
"loss": -0.0017,
"num_tokens": 234191811.0,
"reward": 0.9850781619548797,
"reward_std": 0.2987526074051857,
"rewards/reward_accuracy/mean": 0.8859375,
"rewards/reward_accuracy/std": 0.2965510383248329,
"rewards/reward_format/mean": 0.09914062693715095,
"rewards/reward_format/std": 0.005960265081375838,
"sampling/importance_sampling_ratio/max": 2.435715126991272,
"sampling/importance_sampling_ratio/mean": 0.9867534160614013,
"sampling/importance_sampling_ratio/min": 0.10179056823253632,
"sampling/sampling_logp_difference/max": 1.3606013298034667,
"sampling/sampling_logp_difference/mean": 0.0051634463015943766,
"step": 2070,
"step_time": 7.8618158503100855
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1666.1,
"completions/max_terminated_length": 1519.6,
"completions/mean_length": 159.31328125,
"completions/mean_terminated_length": 144.54681472778321,
"completions/min_length": 62.6,
"completions/min_terminated_length": 62.6,
"entropy": 0.07079208106733859,
"epoch": 4.453961456102784,
"frac_reward_zero_std": 0.78125,
"grad_norm": 0.5703125,
"learning_rate": 9.7921e-06,
"loss": -0.0054,
"num_tokens": 235113509.0,
"reward": 1.0273828148841857,
"reward_std": 0.2523354530334473,
"rewards/reward_accuracy/mean": 0.928125,
"rewards/reward_accuracy/std": 0.24980832934379577,
"rewards/reward_format/mean": 0.09925781339406967,
"rewards/reward_format/std": 0.005916051496751606,
"sampling/importance_sampling_ratio/max": 2.408108675479889,
"sampling/importance_sampling_ratio/mean": 0.9871065139770507,
"sampling/importance_sampling_ratio/min": 0.1144093245267868,
"sampling/sampling_logp_difference/max": 0.714095163345337,
"sampling/sampling_logp_difference/mean": 0.004558845772407949,
"step": 2080,
"step_time": 8.06028911939793
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1722.2,
"completions/max_terminated_length": 1422.9,
"completions/mean_length": 159.81953125,
"completions/mean_terminated_length": 151.70249710083007,
"completions/min_length": 67.2,
"completions/min_terminated_length": 67.2,
"entropy": 0.06418220684863626,
"epoch": 4.475374732334047,
"frac_reward_zero_std": 0.7875,
"grad_norm": 0.78515625,
"learning_rate": 9.791100000000002e-06,
"loss": -0.0112,
"num_tokens": 236044407.0,
"reward": 1.0241601645946503,
"reward_std": 0.25501007586717606,
"rewards/reward_accuracy/mean": 0.924609375,
"rewards/reward_accuracy/std": 0.2533506594598293,
"rewards/reward_format/mean": 0.09955078214406968,
"rewards/reward_format/std": 0.00438030413351953,
"sampling/importance_sampling_ratio/max": 2.4996392726898193,
"sampling/importance_sampling_ratio/mean": 0.988101577758789,
"sampling/importance_sampling_ratio/min": 0.08764938879758119,
"sampling/sampling_logp_difference/max": 0.9312692880630493,
"sampling/sampling_logp_difference/mean": 0.0044564057374373075,
"step": 2090,
"step_time": 8.024358670900984
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1839.7,
"completions/max_terminated_length": 1648.9,
"completions/mean_length": 199.826171875,
"completions/mean_terminated_length": 181.7624496459961,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.08696371647529304,
"epoch": 4.496788008565311,
"frac_reward_zero_std": 0.70625,
"grad_norm": 0.55078125,
"learning_rate": 9.790100000000001e-06,
"loss": -0.0143,
"num_tokens": 237077642.0,
"reward": 0.99595707654953,
"reward_std": 0.2828642189502716,
"rewards/reward_accuracy/mean": 0.896875,
"rewards/reward_accuracy/std": 0.2801231279969215,
"rewards/reward_format/mean": 0.09908203408122063,
"rewards/reward_format/std": 0.006850743247196078,
"sampling/importance_sampling_ratio/max": 2.5123090744018555,
"sampling/importance_sampling_ratio/mean": 0.9794782221317291,
"sampling/importance_sampling_ratio/min": 0.08114426881074906,
"sampling/sampling_logp_difference/max": 0.794606339931488,
"sampling/sampling_logp_difference/mean": 0.005333045125007629,
"step": 2100,
"step_time": 8.97705702000385
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1637.3,
"completions/max_terminated_length": 1582.1,
"completions/mean_length": 169.9796875,
"completions/mean_terminated_length": 159.01034545898438,
"completions/min_length": 62.6,
"completions/min_terminated_length": 62.6,
"entropy": 0.07645585457794368,
"epoch": 4.518201284796574,
"frac_reward_zero_std": 0.76875,
"grad_norm": 0.8046875,
"learning_rate": 9.789100000000001e-06,
"loss": -0.0142,
"num_tokens": 238040070.0,
"reward": 1.0177929818630218,
"reward_std": 0.25959050059318545,
"rewards/reward_accuracy/mean": 0.918359375,
"rewards/reward_accuracy/std": 0.2581544242799282,
"rewards/reward_format/mean": 0.09943359494209289,
"rewards/reward_format/std": 0.0037379376590251923,
"sampling/importance_sampling_ratio/max": 2.216869223117828,
"sampling/importance_sampling_ratio/mean": 0.9745715498924256,
"sampling/importance_sampling_ratio/min": 0.08360667377710343,
"sampling/sampling_logp_difference/max": 0.8369795441627502,
"sampling/sampling_logp_difference/mean": 0.0049792623845860366,
"step": 2110,
"step_time": 7.821563000703463
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1475.3,
"completions/max_terminated_length": 1386.7,
"completions/mean_length": 181.330859375,
"completions/mean_terminated_length": 166.1758544921875,
"completions/min_length": 65.3,
"completions/min_terminated_length": 65.3,
"entropy": 0.07535161459818482,
"epoch": 4.539614561027837,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.6640625,
"learning_rate": 9.7881e-06,
"loss": 0.0046,
"num_tokens": 239019301.0,
"reward": 0.9715625166893005,
"reward_std": 0.3155876360833645,
"rewards/reward_accuracy/mean": 0.872265625,
"rewards/reward_accuracy/std": 0.3137762926518917,
"rewards/reward_format/mean": 0.09929687604308128,
"rewards/reward_format/std": 0.005393980420194566,
"sampling/importance_sampling_ratio/max": 2.5851032018661497,
"sampling/importance_sampling_ratio/mean": 0.9937897861003876,
"sampling/importance_sampling_ratio/min": 0.1833063170313835,
"sampling/sampling_logp_difference/max": 0.7035237789154053,
"sampling/sampling_logp_difference/mean": 0.00464664117898792,
"step": 2120,
"step_time": 7.30794589719153
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.3404663807014003e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.3404663807014003e-06,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1610.8,
"completions/max_terminated_length": 1332.2,
"completions/mean_length": 181.216796875,
"completions/mean_terminated_length": 165.10993499755858,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.07091707922518253,
"epoch": 4.5610278372591,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.8515625,
"learning_rate": 9.7871e-06,
"loss": -0.0077,
"num_tokens": 240005600.0,
"reward": 1.004941427707672,
"reward_std": 0.269658263027668,
"rewards/reward_accuracy/mean": 0.90546875,
"rewards/reward_accuracy/std": 0.2676686063408852,
"rewards/reward_format/mean": 0.0994726575911045,
"rewards/reward_format/std": 0.004322139755822718,
"sampling/importance_sampling_ratio/max": 2.589378321170807,
"sampling/importance_sampling_ratio/mean": 0.9867459952831268,
"sampling/importance_sampling_ratio/min": 0.1000741496682167,
"sampling/sampling_logp_difference/max": 0.8688886880874633,
"sampling/sampling_logp_difference/mean": 0.00457688351161778,
"step": 2130,
"step_time": 7.864862138699391
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1803.8,
"completions/max_terminated_length": 1408.8,
"completions/mean_length": 176.346484375,
"completions/mean_terminated_length": 166.10452880859376,
"completions/min_length": 62.9,
"completions/min_terminated_length": 62.9,
"entropy": 0.07794082672335208,
"epoch": 4.582441113490364,
"frac_reward_zero_std": 0.7125,
"grad_norm": 0.78515625,
"learning_rate": 9.786100000000001e-06,
"loss": -0.0025,
"num_tokens": 240970279.0,
"reward": 0.9908398687839508,
"reward_std": 0.2986170083284378,
"rewards/reward_accuracy/mean": 0.89140625,
"rewards/reward_accuracy/std": 0.29710409343242644,
"rewards/reward_format/mean": 0.09943359494209289,
"rewards/reward_format/std": 0.005302870529703796,
"sampling/importance_sampling_ratio/max": 2.3203123927116396,
"sampling/importance_sampling_ratio/mean": 0.9915559589862823,
"sampling/importance_sampling_ratio/min": 0.0888116448186338,
"sampling/sampling_logp_difference/max": 0.8253662824630738,
"sampling/sampling_logp_difference/mean": 0.0052910540252923965,
"step": 2140,
"step_time": 8.524868061397864
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.2089592246411486e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.2089592246411486e-06,
"completions/clipped_ratio": 0.0171875,
"completions/max_length": 1709.3,
"completions/max_terminated_length": 1615.9,
"completions/mean_length": 209.283984375,
"completions/mean_terminated_length": 177.42144012451172,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.08825421063229441,
"epoch": 4.6038543897216275,
"frac_reward_zero_std": 0.70625,
"grad_norm": 1.8828125,
"learning_rate": 9.7851e-06,
"loss": -0.0138,
"num_tokens": 242019790.0,
"reward": 0.9694140911102295,
"reward_std": 0.31108973547816277,
"rewards/reward_accuracy/mean": 0.870703125,
"rewards/reward_accuracy/std": 0.3080101229250431,
"rewards/reward_format/mean": 0.09871093928813934,
"rewards/reward_format/std": 0.008570267655886709,
"sampling/importance_sampling_ratio/max": 2.280792200565338,
"sampling/importance_sampling_ratio/mean": 0.9886388897895813,
"sampling/importance_sampling_ratio/min": 0.1037389699369669,
"sampling/sampling_logp_difference/max": 0.7944270491600036,
"sampling/sampling_logp_difference/mean": 0.005283630220219493,
"step": 2150,
"step_time": 8.38908263599733
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 5.7220458984375e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 5.7220458984375e-07,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1861.4,
"completions/max_terminated_length": 1609.8,
"completions/mean_length": 196.66484375,
"completions/mean_terminated_length": 178.1639846801758,
"completions/min_length": 71.4,
"completions/min_terminated_length": 71.4,
"entropy": 0.08580228919163346,
"epoch": 4.625267665952891,
"frac_reward_zero_std": 0.7,
"grad_norm": 1.5703125,
"learning_rate": 9.7841e-06,
"loss": -0.0094,
"num_tokens": 243045988.0,
"reward": 0.9642773687839508,
"reward_std": 0.32801089733839034,
"rewards/reward_accuracy/mean": 0.865234375,
"rewards/reward_accuracy/std": 0.3259991258382797,
"rewards/reward_format/mean": 0.09904296919703484,
"rewards/reward_format/std": 0.006392091745510697,
"sampling/importance_sampling_ratio/max": 2.4289372324943543,
"sampling/importance_sampling_ratio/mean": 0.9706053137779236,
"sampling/importance_sampling_ratio/min": 0.025435397028923036,
"sampling/sampling_logp_difference/max": 0.9564635992050171,
"sampling/sampling_logp_difference/mean": 0.005238713696599007,
"step": 2160,
"step_time": 8.966212662504404
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1559.7,
"completions/max_terminated_length": 1428.9,
"completions/mean_length": 171.7265625,
"completions/mean_terminated_length": 158.6864471435547,
"completions/min_length": 68.8,
"completions/min_terminated_length": 68.8,
"entropy": 0.06829877183772623,
"epoch": 4.646680942184155,
"frac_reward_zero_std": 0.74375,
"grad_norm": 1.109375,
"learning_rate": 9.783100000000001e-06,
"loss": -0.0041,
"num_tokens": 244000872.0,
"reward": 1.0152929902076722,
"reward_std": 0.2500875130295753,
"rewards/reward_accuracy/mean": 0.916015625,
"rewards/reward_accuracy/std": 0.2484466627240181,
"rewards/reward_format/mean": 0.0992773450911045,
"rewards/reward_format/std": 0.005242691724561155,
"sampling/importance_sampling_ratio/max": 2.3250232219696043,
"sampling/importance_sampling_ratio/mean": 0.9786055505275726,
"sampling/importance_sampling_ratio/min": 0.07453126609325408,
"sampling/sampling_logp_difference/max": 1.0933011054992676,
"sampling/sampling_logp_difference/mean": 0.004774229438044131,
"step": 2170,
"step_time": 7.585577700800786
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 9.370725138069247e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 9.370725138069247e-07,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 1622.1,
"completions/max_terminated_length": 1428.6,
"completions/mean_length": 188.590234375,
"completions/mean_terminated_length": 166.7021057128906,
"completions/min_length": 61.4,
"completions/min_terminated_length": 61.4,
"entropy": 0.0849621957167983,
"epoch": 4.668094218415417,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.57421875,
"learning_rate": 9.7821e-06,
"loss": 0.0015,
"num_tokens": 244999215.0,
"reward": 1.0197265923023224,
"reward_std": 0.2503895789384842,
"rewards/reward_accuracy/mean": 0.920703125,
"rewards/reward_accuracy/std": 0.24756357073783875,
"rewards/reward_format/mean": 0.09902343824505806,
"rewards/reward_format/std": 0.005879755993373692,
"sampling/importance_sampling_ratio/max": 2.469088554382324,
"sampling/importance_sampling_ratio/mean": 0.979578572511673,
"sampling/importance_sampling_ratio/min": 0.11522134207189083,
"sampling/sampling_logp_difference/max": 0.7691325426101685,
"sampling/sampling_logp_difference/mean": 0.005316501692868769,
"step": 2180,
"step_time": 7.949738726801297
},
{
"clip_ratio/high_max": 1.992031866393518e-06,
"clip_ratio/high_mean": 2.4900398329918973e-07,
"clip_ratio/low_mean": 1.521369563306507e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.7703735693430644e-06,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1802.1,
"completions/max_terminated_length": 1514.6,
"completions/mean_length": 195.33203125,
"completions/mean_terminated_length": 172.23922119140624,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.08400442185811699,
"epoch": 4.689507494646681,
"frac_reward_zero_std": 0.7375,
"grad_norm": 0.671875,
"learning_rate": 9.781100000000002e-06,
"loss": -0.0099,
"num_tokens": 246008369.0,
"reward": 0.9962500274181366,
"reward_std": 0.29630859941244125,
"rewards/reward_accuracy/mean": 0.897265625,
"rewards/reward_accuracy/std": 0.29331949204206464,
"rewards/reward_format/mean": 0.0989843763411045,
"rewards/reward_format/std": 0.0078062117798253896,
"sampling/importance_sampling_ratio/max": 2.5167356967926025,
"sampling/importance_sampling_ratio/mean": 0.9783742666244507,
"sampling/importance_sampling_ratio/min": 0.07505913749337197,
"sampling/sampling_logp_difference/max": 0.8785338521003723,
"sampling/sampling_logp_difference/mean": 0.005175079079344868,
"step": 2190,
"step_time": 8.66743052550446
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 1690.0,
"completions/max_terminated_length": 1621.3,
"completions/mean_length": 212.880859375,
"completions/mean_terminated_length": 191.45450134277343,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.09540253672748804,
"epoch": 4.710920770877944,
"frac_reward_zero_std": 0.70625,
"grad_norm": 0.3828125,
"learning_rate": 9.780100000000001e-06,
"loss": -0.0066,
"num_tokens": 247072800.0,
"reward": 0.9864453256130219,
"reward_std": 0.2926752604544163,
"rewards/reward_accuracy/mean": 0.8875,
"rewards/reward_accuracy/std": 0.2902793921530247,
"rewards/reward_format/mean": 0.09894531369209289,
"rewards/reward_format/std": 0.007230436359532177,
"sampling/importance_sampling_ratio/max": 2.5507349967956543,
"sampling/importance_sampling_ratio/mean": 0.9820370733737945,
"sampling/importance_sampling_ratio/min": 0.08231296204030514,
"sampling/sampling_logp_difference/max": 0.8357828259468079,
"sampling/sampling_logp_difference/mean": 0.005763309448957444,
"step": 2200,
"step_time": 8.275506640794628
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.248705115765915e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.248705115765915e-06,
"completions/clipped_ratio": 0.023828125,
"completions/max_length": 1873.4,
"completions/max_terminated_length": 1523.8,
"completions/mean_length": 229.976171875,
"completions/mean_terminated_length": 186.45760040283204,
"completions/min_length": 59.3,
"completions/min_terminated_length": 59.3,
"entropy": 0.09123739684000612,
"epoch": 4.732334047109208,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.396484375,
"learning_rate": 9.779100000000001e-06,
"loss": -0.0091,
"num_tokens": 248174339.0,
"reward": 0.994511729478836,
"reward_std": 0.2701865181326866,
"rewards/reward_accuracy/mean": 0.896484375,
"rewards/reward_accuracy/std": 0.26520081162452697,
"rewards/reward_format/mean": 0.09802734404802323,
"rewards/reward_format/std": 0.010915013542398811,
"sampling/importance_sampling_ratio/max": 2.347126340866089,
"sampling/importance_sampling_ratio/mean": 0.9640675842761993,
"sampling/importance_sampling_ratio/min": 0.058619886497035624,
"sampling/sampling_logp_difference/max": 1.0788860738277435,
"sampling/sampling_logp_difference/mean": 0.005326095875352621,
"step": 2210,
"step_time": 9.421573199500562
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.017578125,
"completions/max_length": 1975.2,
"completions/max_terminated_length": 1784.4,
"completions/mean_length": 226.7453125,
"completions/mean_terminated_length": 194.62357635498046,
"completions/min_length": 65.3,
"completions/min_terminated_length": 65.3,
"entropy": 0.09808328119106591,
"epoch": 4.7537473233404715,
"frac_reward_zero_std": 0.725,
"grad_norm": 0.375,
"learning_rate": 9.7781e-06,
"loss": -0.0222,
"num_tokens": 249271671.0,
"reward": 0.9534570515155792,
"reward_std": 0.3409714996814728,
"rewards/reward_accuracy/mean": 0.8546875,
"rewards/reward_accuracy/std": 0.3386022850871086,
"rewards/reward_format/mean": 0.09876953139901161,
"rewards/reward_format/std": 0.0077095223823562264,
"sampling/importance_sampling_ratio/max": 2.5454773187637327,
"sampling/importance_sampling_ratio/mean": 0.9711083889007568,
"sampling/importance_sampling_ratio/min": 0.033962635695934294,
"sampling/sampling_logp_difference/max": 0.949769115447998,
"sampling/sampling_logp_difference/mean": 0.005811973474919796,
"step": 2220,
"step_time": 9.669196539497353
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.013671875,
"completions/max_length": 1833.2,
"completions/max_terminated_length": 1620.6,
"completions/mean_length": 212.1921875,
"completions/mean_terminated_length": 187.11306915283203,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.08953576134517789,
"epoch": 4.775160599571734,
"frac_reward_zero_std": 0.725,
"grad_norm": 0.72265625,
"learning_rate": 9.7771e-06,
"loss": -0.008,
"num_tokens": 250332851.0,
"reward": 0.991992199420929,
"reward_std": 0.3011354684829712,
"rewards/reward_accuracy/mean": 0.893359375,
"rewards/reward_accuracy/std": 0.29779814183712006,
"rewards/reward_format/mean": 0.0986328125,
"rewards/reward_format/std": 0.007914522453211248,
"sampling/importance_sampling_ratio/max": 2.4657883644104004,
"sampling/importance_sampling_ratio/mean": 0.9748385787010193,
"sampling/importance_sampling_ratio/min": 0.045927174761891364,
"sampling/sampling_logp_difference/max": 0.9461305618286133,
"sampling/sampling_logp_difference/mean": 0.005509271938353777,
"step": 2230,
"step_time": 8.944138980685967
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.3468326187648927e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.3468326187648927e-06,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1817.1,
"completions/max_terminated_length": 1685.6,
"completions/mean_length": 193.576953125,
"completions/mean_terminated_length": 179.0530548095703,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.08151403218507766,
"epoch": 4.796573875802998,
"frac_reward_zero_std": 0.7375,
"grad_norm": 0.37890625,
"learning_rate": 9.776100000000001e-06,
"loss": -0.0114,
"num_tokens": 251351096.0,
"reward": 1.0052344083786011,
"reward_std": 0.28796522617340087,
"rewards/reward_accuracy/mean": 0.905859375,
"rewards/reward_accuracy/std": 0.28608872890472414,
"rewards/reward_format/mean": 0.09937500134110451,
"rewards/reward_format/std": 0.005896919290535152,
"sampling/importance_sampling_ratio/max": 2.54252712726593,
"sampling/importance_sampling_ratio/mean": 0.9708419442176819,
"sampling/importance_sampling_ratio/min": 0.04748087078332901,
"sampling/sampling_logp_difference/max": 0.8803086280822754,
"sampling/sampling_logp_difference/mean": 0.0054293053690344095,
"step": 2240,
"step_time": 8.908298324605857
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.222971076866088e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.222971076866088e-06,
"completions/clipped_ratio": 0.021484375,
"completions/max_length": 1796.1,
"completions/max_terminated_length": 1595.0,
"completions/mean_length": 223.38046875,
"completions/mean_terminated_length": 183.85076293945312,
"completions/min_length": 68.4,
"completions/min_terminated_length": 68.4,
"entropy": 0.09370366488583386,
"epoch": 4.817987152034261,
"frac_reward_zero_std": 0.76875,
"grad_norm": 0.75,
"learning_rate": 9.7751e-06,
"loss": -0.0208,
"num_tokens": 252445814.0,
"reward": 0.9686718940734863,
"reward_std": 0.31389373987913133,
"rewards/reward_accuracy/mean": 0.8703125,
"rewards/reward_accuracy/std": 0.31046067997813226,
"rewards/reward_format/mean": 0.09835937470197678,
"rewards/reward_format/std": 0.008930181409232319,
"sampling/importance_sampling_ratio/max": 2.570297908782959,
"sampling/importance_sampling_ratio/mean": 0.9833467185497284,
"sampling/importance_sampling_ratio/min": 0.016333626210689546,
"sampling/sampling_logp_difference/max": 0.8726479947566986,
"sampling/sampling_logp_difference/mean": 0.005547507666051388,
"step": 2250,
"step_time": 8.809942481594044
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.8564946205733575e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.8564946205733575e-06,
"completions/clipped_ratio": 0.02890625,
"completions/max_length": 1962.0,
"completions/max_terminated_length": 1746.8,
"completions/mean_length": 262.2890625,
"completions/mean_terminated_length": 209.58065643310547,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.11199936117045581,
"epoch": 4.839400428265525,
"frac_reward_zero_std": 0.725,
"grad_norm": 0.71484375,
"learning_rate": 9.7741e-06,
"loss": -0.0146,
"num_tokens": 253638298.0,
"reward": 0.9427148699760437,
"reward_std": 0.3403990387916565,
"rewards/reward_accuracy/mean": 0.844921875,
"rewards/reward_accuracy/std": 0.33587906807661055,
"rewards/reward_format/mean": 0.09779297336935996,
"rewards/reward_format/std": 0.011930074635893106,
"sampling/importance_sampling_ratio/max": 2.595848727226257,
"sampling/importance_sampling_ratio/mean": 0.9563285887241364,
"sampling/importance_sampling_ratio/min": 0.04551267977803945,
"sampling/sampling_logp_difference/max": 0.8743456780910492,
"sampling/sampling_logp_difference/mean": 0.006298250332474708,
"step": 2260,
"step_time": 9.936624127805407
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01328125,
"completions/max_length": 1792.1,
"completions/max_terminated_length": 1666.1,
"completions/mean_length": 202.0859375,
"completions/mean_terminated_length": 177.6548110961914,
"completions/min_length": 68.5,
"completions/min_terminated_length": 68.5,
"entropy": 0.08866131356917321,
"epoch": 4.860813704496788,
"frac_reward_zero_std": 0.725,
"grad_norm": 0.53515625,
"learning_rate": 9.773100000000001e-06,
"loss": -0.0053,
"num_tokens": 254673094.0,
"reward": 1.0216211140155793,
"reward_std": 0.24170828908681868,
"rewards/reward_accuracy/mean": 0.92265625,
"rewards/reward_accuracy/std": 0.23907576501369476,
"rewards/reward_format/mean": 0.09896484464406967,
"rewards/reward_format/std": 0.007286950154229999,
"sampling/importance_sampling_ratio/max": 2.427917718887329,
"sampling/importance_sampling_ratio/mean": 0.9815936505794525,
"sampling/importance_sampling_ratio/min": 0.08036115914583206,
"sampling/sampling_logp_difference/max": 0.9833181619644165,
"sampling/sampling_logp_difference/mean": 0.005642562196590007,
"step": 2270,
"step_time": 8.683277568596532
},
{
"clip_ratio/high_max": 6.429175555240363e-05,
"clip_ratio/high_mean": 8.036469444050453e-06,
"clip_ratio/low_mean": 2.0722062117783937e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.0108675655828848e-05,
"completions/clipped_ratio": 0.02890625,
"completions/max_length": 2011.8,
"completions/max_terminated_length": 1801.5,
"completions/mean_length": 244.678515625,
"completions/mean_terminated_length": 191.76283264160156,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.11101097697392107,
"epoch": 4.882226980728051,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.51953125,
"learning_rate": 9.772100000000001e-06,
"loss": -0.0263,
"num_tokens": 255815631.0,
"reward": 0.9891406416893005,
"reward_std": 0.30459093749523164,
"rewards/reward_accuracy/mean": 0.891015625,
"rewards/reward_accuracy/std": 0.2995521530508995,
"rewards/reward_format/mean": 0.09812500178813935,
"rewards/reward_format/std": 0.011402385728433728,
"sampling/importance_sampling_ratio/max": 2.47555273771286,
"sampling/importance_sampling_ratio/mean": 0.9687107086181641,
"sampling/importance_sampling_ratio/min": 0.0,
"sampling/sampling_logp_difference/max": 0.9624327540397644,
"sampling/sampling_logp_difference/mean": 0.0060417496133595705,
"step": 2280,
"step_time": 9.844116887998826
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1979.2,
"completions/max_terminated_length": 1797.8,
"completions/mean_length": 193.8609375,
"completions/mean_terminated_length": 176.480419921875,
"completions/min_length": 63.1,
"completions/min_terminated_length": 63.1,
"entropy": 0.0783037640620023,
"epoch": 4.9036402569593145,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.73828125,
"learning_rate": 9.7711e-06,
"loss": -0.0061,
"num_tokens": 256826939.0,
"reward": 1.003027367591858,
"reward_std": 0.27844581082463266,
"rewards/reward_accuracy/mean": 0.90390625,
"rewards/reward_accuracy/std": 0.27574645057320596,
"rewards/reward_format/mean": 0.09912109449505806,
"rewards/reward_format/std": 0.007335902634076774,
"sampling/importance_sampling_ratio/max": 2.516179418563843,
"sampling/importance_sampling_ratio/mean": 0.9768676638603211,
"sampling/importance_sampling_ratio/min": 0.0430468525737524,
"sampling/sampling_logp_difference/max": 1.0739474058151246,
"sampling/sampling_logp_difference/mean": 0.005295001761987805,
"step": 2290,
"step_time": 9.541525884396105
},
{
"clip_ratio/high_max": 2.5974860909627752e-05,
"clip_ratio/high_mean": 3.246857613703469e-06,
"clip_ratio/low_mean": 3.547928986336046e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 6.794786509090045e-06,
"completions/clipped_ratio": 0.0171875,
"completions/max_length": 1973.3,
"completions/max_terminated_length": 1786.1,
"completions/mean_length": 230.69296875,
"completions/mean_terminated_length": 199.18791656494142,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.09776845169253648,
"epoch": 4.925053533190578,
"frac_reward_zero_std": 0.71875,
"grad_norm": 0.333984375,
"learning_rate": 9.770100000000002e-06,
"loss": -0.0097,
"num_tokens": 257925465.0,
"reward": 1.0038867533206939,
"reward_std": 0.29047847390174864,
"rewards/reward_accuracy/mean": 0.90546875,
"rewards/reward_accuracy/std": 0.28581098318099973,
"rewards/reward_format/mean": 0.0984179712831974,
"rewards/reward_format/std": 0.009709775634109973,
"sampling/importance_sampling_ratio/max": 2.6093069314956665,
"sampling/importance_sampling_ratio/mean": 0.9602207124233246,
"sampling/importance_sampling_ratio/min": 0.0,
"sampling/sampling_logp_difference/max": 0.9501909017562866,
"sampling/sampling_logp_difference/mean": 0.005854196520522237,
"step": 2300,
"step_time": 9.395679875994393
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.734363167495758e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.734363167495758e-06,
"completions/clipped_ratio": 0.03671875,
"completions/max_length": 1806.6,
"completions/max_terminated_length": 1658.3,
"completions/mean_length": 281.35390625,
"completions/mean_terminated_length": 215.01718444824218,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"entropy": 0.10897608175873756,
"epoch": 4.946466809421842,
"frac_reward_zero_std": 0.70625,
"grad_norm": 0.50390625,
"learning_rate": 9.769100000000001e-06,
"loss": -0.0206,
"num_tokens": 259168211.0,
"reward": 0.9879883229732513,
"reward_std": 0.2995134241878986,
"rewards/reward_accuracy/mean": 0.891015625,
"rewards/reward_accuracy/std": 0.29208410158753395,
"rewards/reward_format/mean": 0.09697265848517418,
"rewards/reward_format/std": 0.013821890950202942,
"sampling/importance_sampling_ratio/max": 2.6028293132781983,
"sampling/importance_sampling_ratio/mean": 0.9686287939548492,
"sampling/importance_sampling_ratio/min": 0.0898590438067913,
"sampling/sampling_logp_difference/max": 0.8076077222824096,
"sampling/sampling_logp_difference/mean": 0.005959991738200188,
"step": 2310,
"step_time": 9.415581606992054
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.1699475180648732e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.1699475180648732e-06,
"completions/clipped_ratio": 0.030859375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1959.6,
"completions/mean_length": 298.7734375,
"completions/mean_terminated_length": 243.15517883300782,
"completions/min_length": 71.5,
"completions/min_terminated_length": 71.5,
"entropy": 0.13118589436635375,
"epoch": 4.967880085653105,
"frac_reward_zero_std": 0.6625,
"grad_norm": 0.259765625,
"learning_rate": 9.7681e-06,
"loss": -0.0212,
"num_tokens": 260452623.0,
"reward": 0.9819726765155792,
"reward_std": 0.3216537445783615,
"rewards/reward_accuracy/mean": 0.884375,
"rewards/reward_accuracy/std": 0.3153507113456726,
"rewards/reward_format/mean": 0.09759765863418579,
"rewards/reward_format/std": 0.013551969872787594,
"sampling/importance_sampling_ratio/max": 2.688900685310364,
"sampling/importance_sampling_ratio/mean": 0.9521142482757569,
"sampling/importance_sampling_ratio/min": 0.001366019924171269,
"sampling/sampling_logp_difference/max": 0.9410638332366943,
"sampling/sampling_logp_difference/mean": 0.006703994330018758,
"step": 2320,
"step_time": 10.579705131592345
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01484375,
"completions/max_length": 2044.0,
"completions/max_terminated_length": 1808.2,
"completions/mean_length": 238.441015625,
"completions/mean_terminated_length": 211.04193267822265,
"completions/min_length": 73.5,
"completions/min_terminated_length": 73.5,
"entropy": 0.10004255888052285,
"epoch": 4.989293361884369,
"frac_reward_zero_std": 0.70625,
"grad_norm": 1.1015625,
"learning_rate": 9.7671e-06,
"loss": -0.0109,
"num_tokens": 261580680.0,
"reward": 1.0002734661102295,
"reward_std": 0.2849088445305824,
"rewards/reward_accuracy/mean": 0.9015625,
"rewards/reward_accuracy/std": 0.2809669919312,
"rewards/reward_format/mean": 0.09871093928813934,
"rewards/reward_format/std": 0.009617776866070927,
"sampling/importance_sampling_ratio/max": 2.6115639209747314,
"sampling/importance_sampling_ratio/mean": 0.983322536945343,
"sampling/importance_sampling_ratio/min": 0.009596103802323341,
"sampling/sampling_logp_difference/max": 0.8751127183437347,
"sampling/sampling_logp_difference/mean": 0.005895709851756692,
"step": 2330,
"step_time": 10.08629838218767
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1812.2,
"completions/max_terminated_length": 1709.1,
"completions/mean_length": 229.435546875,
"completions/mean_terminated_length": 213.2009063720703,
"completions/min_length": 72.3,
"completions/min_terminated_length": 72.3,
"entropy": 0.09568726033903659,
"epoch": 5.010706638115631,
"frac_reward_zero_std": 0.75625,
"grad_norm": 0.75,
"learning_rate": 9.766100000000001e-06,
"loss": -0.0147,
"num_tokens": 262683795.0,
"reward": 1.0123437643051147,
"reward_std": 0.2675609141588211,
"rewards/reward_accuracy/mean": 0.91328125,
"rewards/reward_accuracy/std": 0.26485550254583357,
"rewards/reward_format/mean": 0.09906249940395355,
"rewards/reward_format/std": 0.007397540635429323,
"sampling/importance_sampling_ratio/max": 2.5975226163864136,
"sampling/importance_sampling_ratio/mean": 0.978242027759552,
"sampling/importance_sampling_ratio/min": 0.0870393119752407,
"sampling/sampling_logp_difference/max": 1.2491745114326478,
"sampling/sampling_logp_difference/mean": 0.005445632431656122,
"step": 2340,
"step_time": 8.716531403400586
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01328125,
"completions/max_length": 1922.9,
"completions/max_terminated_length": 1692.3,
"completions/mean_length": 222.668359375,
"completions/mean_terminated_length": 198.46761779785157,
"completions/min_length": 72.1,
"completions/min_terminated_length": 72.1,
"entropy": 0.09606688623316587,
"epoch": 5.032119914346895,
"frac_reward_zero_std": 0.725,
"grad_norm": 0.69921875,
"learning_rate": 9.7651e-06,
"loss": -0.0114,
"num_tokens": 263772610.0,
"reward": 1.0120898604393005,
"reward_std": 0.2458895482122898,
"rewards/reward_accuracy/mean": 0.91328125,
"rewards/reward_accuracy/std": 0.24242851212620736,
"rewards/reward_format/mean": 0.09880859479308128,
"rewards/reward_format/std": 0.008377623744308949,
"sampling/importance_sampling_ratio/max": 2.57693190574646,
"sampling/importance_sampling_ratio/mean": 0.9830444872379303,
"sampling/importance_sampling_ratio/min": 0.08874360397458077,
"sampling/sampling_logp_difference/max": 0.7989751875400544,
"sampling/sampling_logp_difference/mean": 0.0058446109760552645,
"step": 2350,
"step_time": 9.206956293196708
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.734217039484065e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.734217039484065e-06,
"completions/clipped_ratio": 0.0234375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1707.3,
"completions/mean_length": 237.8328125,
"completions/mean_terminated_length": 194.77003784179686,
"completions/min_length": 67.1,
"completions/min_terminated_length": 67.1,
"entropy": 0.10490963151678442,
"epoch": 5.053533190578158,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.2041015625,
"learning_rate": 9.7641e-06,
"loss": -0.0095,
"num_tokens": 264894742.0,
"reward": 0.9882812738418579,
"reward_std": 0.30687628537416456,
"rewards/reward_accuracy/mean": 0.890234375,
"rewards/reward_accuracy/std": 0.30194777250289917,
"rewards/reward_format/mean": 0.09804687649011612,
"rewards/reward_format/std": 0.01186409555375576,
"sampling/importance_sampling_ratio/max": 2.5093424797058104,
"sampling/importance_sampling_ratio/mean": 0.9654182076454163,
"sampling/importance_sampling_ratio/min": 0.025465759634971618,
"sampling/sampling_logp_difference/max": 0.829421991109848,
"sampling/sampling_logp_difference/mean": 0.005817542830482125,
"step": 2360,
"step_time": 9.975346906096092
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1674.1,
"completions/max_terminated_length": 1391.8,
"completions/mean_length": 186.836328125,
"completions/mean_terminated_length": 170.8824249267578,
"completions/min_length": 68.5,
"completions/min_terminated_length": 68.5,
"entropy": 0.07341498509049416,
"epoch": 5.074946466809422,
"frac_reward_zero_std": 0.76875,
"grad_norm": 0.8046875,
"learning_rate": 9.763100000000001e-06,
"loss": -0.0076,
"num_tokens": 265897139.0,
"reward": 1.0218164324760437,
"reward_std": 0.2472201593220234,
"rewards/reward_accuracy/mean": 0.92265625,
"rewards/reward_accuracy/std": 0.24448850527405738,
"rewards/reward_format/mean": 0.09916015863418579,
"rewards/reward_format/std": 0.006549968058243394,
"sampling/importance_sampling_ratio/max": 2.5292384147644045,
"sampling/importance_sampling_ratio/mean": 0.9850484192371368,
"sampling/importance_sampling_ratio/min": 0.13628658279776573,
"sampling/sampling_logp_difference/max": 0.8645964980125427,
"sampling/sampling_logp_difference/mean": 0.0049667911604046825,
"step": 2370,
"step_time": 8.252097694305121
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 1812.5,
"completions/max_terminated_length": 1566.4,
"completions/mean_length": 203.037890625,
"completions/mean_terminated_length": 181.4959716796875,
"completions/min_length": 68.4,
"completions/min_terminated_length": 68.4,
"entropy": 0.08049446353688836,
"epoch": 5.0963597430406855,
"frac_reward_zero_std": 0.78125,
"grad_norm": 0.66015625,
"learning_rate": 9.762100000000001e-06,
"loss": -0.0068,
"num_tokens": 266939556.0,
"reward": 1.0097461104393006,
"reward_std": 0.2701022580265999,
"rewards/reward_accuracy/mean": 0.9109375,
"rewards/reward_accuracy/std": 0.26634401082992554,
"rewards/reward_format/mean": 0.09880859553813934,
"rewards/reward_format/std": 0.008632312202826143,
"sampling/importance_sampling_ratio/max": 2.4711153745651244,
"sampling/importance_sampling_ratio/mean": 0.9794492781162262,
"sampling/importance_sampling_ratio/min": 0.12542862631380558,
"sampling/sampling_logp_difference/max": 1.0802495360374451,
"sampling/sampling_logp_difference/mean": 0.005158733995631337,
"step": 2380,
"step_time": 8.870209813604015
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 1738.4,
"completions/max_terminated_length": 1560.5,
"completions/mean_length": 178.856640625,
"completions/mean_terminated_length": 156.98442687988282,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.07556660398840905,
"epoch": 5.117773019271949,
"frac_reward_zero_std": 0.8125,
"grad_norm": 0.72265625,
"learning_rate": 9.7611e-06,
"loss": -0.0034,
"num_tokens": 267912485.0,
"reward": 1.0250976800918579,
"reward_std": 0.25202338993549345,
"rewards/reward_accuracy/mean": 0.926171875,
"rewards/reward_accuracy/std": 0.24872156977653503,
"rewards/reward_format/mean": 0.09892578274011612,
"rewards/reward_format/std": 0.0074863382149487736,
"sampling/importance_sampling_ratio/max": 2.3229947090148926,
"sampling/importance_sampling_ratio/mean": 0.9754414737224579,
"sampling/importance_sampling_ratio/min": 0.08283874886110425,
"sampling/sampling_logp_difference/max": 0.7435326516628266,
"sampling/sampling_logp_difference/mean": 0.004891591868363321,
"step": 2390,
"step_time": 8.489010535994021
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0171875,
"completions/max_length": 1854.9,
"completions/max_terminated_length": 1604.2,
"completions/mean_length": 218.796875,
"completions/mean_terminated_length": 186.81197967529297,
"completions/min_length": 73.1,
"completions/min_terminated_length": 73.1,
"entropy": 0.08994116135872901,
"epoch": 5.139186295503212,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.69921875,
"learning_rate": 9.760100000000002e-06,
"loss": -0.0116,
"num_tokens": 268994829.0,
"reward": 0.9801172196865082,
"reward_std": 0.31888658851385115,
"rewards/reward_accuracy/mean": 0.881640625,
"rewards/reward_accuracy/std": 0.3147380486130714,
"rewards/reward_format/mean": 0.0984765648841858,
"rewards/reward_format/std": 0.009579169959761203,
"sampling/importance_sampling_ratio/max": 2.5444372653961183,
"sampling/importance_sampling_ratio/mean": 0.9715263545513153,
"sampling/importance_sampling_ratio/min": 0.034004293754696845,
"sampling/sampling_logp_difference/max": 1.0891247034072875,
"sampling/sampling_logp_difference/mean": 0.005226369202136994,
"step": 2400,
"step_time": 9.252903271499964
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1661.9,
"completions/max_terminated_length": 1378.8,
"completions/mean_length": 189.33671875,
"completions/mean_terminated_length": 170.64180221557618,
"completions/min_length": 62.0,
"completions/min_terminated_length": 62.0,
"entropy": 0.07746629258617758,
"epoch": 5.160599571734475,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.67578125,
"learning_rate": 9.759100000000001e-06,
"loss": -0.0037,
"num_tokens": 269994459.0,
"reward": 1.036718761920929,
"reward_std": 0.23912015706300735,
"rewards/reward_accuracy/mean": 0.9375,
"rewards/reward_accuracy/std": 0.2362138643860817,
"rewards/reward_format/mean": 0.09921875149011612,
"rewards/reward_format/std": 0.006156962853856385,
"sampling/importance_sampling_ratio/max": 2.5651718378067017,
"sampling/importance_sampling_ratio/mean": 0.9939302027225494,
"sampling/importance_sampling_ratio/min": 0.059226608276367186,
"sampling/sampling_logp_difference/max": 1.1034000098705292,
"sampling/sampling_logp_difference/mean": 0.005150850210338831,
"step": 2410,
"step_time": 7.962631172503461
},
{
"clip_ratio/high_max": 1.8124237431038637e-05,
"clip_ratio/high_mean": 2.2655296788798297e-06,
"clip_ratio/low_mean": 5.489421027959906e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.8144717816758204e-06,
"completions/clipped_ratio": 0.016796875,
"completions/max_length": 2025.6,
"completions/max_terminated_length": 1788.4,
"completions/mean_length": 221.306640625,
"completions/mean_terminated_length": 190.14471435546875,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.10178385940380394,
"epoch": 5.182012847965739,
"frac_reward_zero_std": 0.76875,
"grad_norm": 0.33984375,
"learning_rate": 9.7581e-06,
"loss": -0.0157,
"num_tokens": 271075580.0,
"reward": 1.024589878320694,
"reward_std": 0.25371187180280685,
"rewards/reward_accuracy/mean": 0.926171875,
"rewards/reward_accuracy/std": 0.24866309612989426,
"rewards/reward_format/mean": 0.09841796979308129,
"rewards/reward_format/std": 0.010078394832089544,
"sampling/importance_sampling_ratio/max": 2.4059510469436645,
"sampling/importance_sampling_ratio/mean": 0.9712713599205017,
"sampling/importance_sampling_ratio/min": 0.016119415685534478,
"sampling/sampling_logp_difference/max": 0.890647292137146,
"sampling/sampling_logp_difference/mean": 0.005788197694346309,
"step": 2420,
"step_time": 10.001629790496372
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 2019.8,
"completions/max_terminated_length": 1664.2,
"completions/mean_length": 203.0859375,
"completions/mean_terminated_length": 185.02481842041016,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.08731190357357263,
"epoch": 5.203426124197002,
"frac_reward_zero_std": 0.7625,
"grad_norm": 0.6015625,
"learning_rate": 9.7571e-06,
"loss": -0.0112,
"num_tokens": 272111144.0,
"reward": 1.0081250309944152,
"reward_std": 0.281161405146122,
"rewards/reward_accuracy/mean": 0.908984375,
"rewards/reward_accuracy/std": 0.2782194584608078,
"rewards/reward_format/mean": 0.09914062693715095,
"rewards/reward_format/std": 0.006859813584014773,
"sampling/importance_sampling_ratio/max": 2.562558650970459,
"sampling/importance_sampling_ratio/mean": 0.9836407423019409,
"sampling/importance_sampling_ratio/min": 0.031214351300150156,
"sampling/sampling_logp_difference/max": 1.0334914565086364,
"sampling/sampling_logp_difference/mean": 0.005232515605166554,
"step": 2430,
"step_time": 9.716919935515033
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1831.9,
"completions/max_terminated_length": 1717.9,
"completions/mean_length": 220.789453125,
"completions/mean_terminated_length": 202.84822692871094,
"completions/min_length": 67.6,
"completions/min_terminated_length": 67.6,
"entropy": 0.09161239392124117,
"epoch": 5.224839400428266,
"frac_reward_zero_std": 0.7375,
"grad_norm": 0.36328125,
"learning_rate": 9.756100000000001e-06,
"loss": -0.0135,
"num_tokens": 273193037.0,
"reward": 0.9982031583786011,
"reward_std": 0.29956541657447816,
"rewards/reward_accuracy/mean": 0.89921875,
"rewards/reward_accuracy/std": 0.29642422050237655,
"rewards/reward_format/mean": 0.09898437708616256,
"rewards/reward_format/std": 0.007902015093713998,
"sampling/importance_sampling_ratio/max": 2.586853194236755,
"sampling/importance_sampling_ratio/mean": 0.9729622006416321,
"sampling/importance_sampling_ratio/min": 0.007696037739515304,
"sampling/sampling_logp_difference/max": 0.6684958934783936,
"sampling/sampling_logp_difference/mean": 0.005379791185259819,
"step": 2440,
"step_time": 9.038645101593284
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.019140625,
"completions/max_length": 1929.3,
"completions/max_terminated_length": 1809.6,
"completions/mean_length": 235.753125,
"completions/mean_terminated_length": 200.70538482666015,
"completions/min_length": 60.9,
"completions/min_terminated_length": 60.9,
"entropy": 0.10268869888968765,
"epoch": 5.2462526766595285,
"frac_reward_zero_std": 0.7125,
"grad_norm": 0.78125,
"learning_rate": 9.7551e-06,
"loss": -0.0214,
"num_tokens": 274310101.0,
"reward": 1.0176562666893005,
"reward_std": 0.26576522141695025,
"rewards/reward_accuracy/mean": 0.919140625,
"rewards/reward_accuracy/std": 0.26149433106184006,
"rewards/reward_format/mean": 0.09851562678813934,
"rewards/reward_format/std": 0.009383460832759738,
"sampling/importance_sampling_ratio/max": 2.696877181529999,
"sampling/importance_sampling_ratio/mean": 0.9661023557186127,
"sampling/importance_sampling_ratio/min": 0.04928179057314992,
"sampling/sampling_logp_difference/max": 0.784824275970459,
"sampling/sampling_logp_difference/mean": 0.005760889407247305,
"step": 2450,
"step_time": 9.757179019608884
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1861.0,
"completions/max_terminated_length": 1535.5,
"completions/mean_length": 193.831640625,
"completions/mean_terminated_length": 180.72005615234374,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.08586626178584993,
"epoch": 5.267665952890792,
"frac_reward_zero_std": 0.76875,
"grad_norm": 0.8671875,
"learning_rate": 9.7541e-06,
"loss": -0.0006,
"num_tokens": 275319142.0,
"reward": 1.0215429782867431,
"reward_std": 0.2600876346230507,
"rewards/reward_accuracy/mean": 0.922265625,
"rewards/reward_accuracy/std": 0.25781902521848676,
"rewards/reward_format/mean": 0.0992773450911045,
"rewards/reward_format/std": 0.006203658482991159,
"sampling/importance_sampling_ratio/max": 2.628754186630249,
"sampling/importance_sampling_ratio/mean": 0.977933156490326,
"sampling/importance_sampling_ratio/min": 0.08611526265740395,
"sampling/sampling_logp_difference/max": 0.7860185861587524,
"sampling/sampling_logp_difference/mean": 0.005368784628808498,
"step": 2460,
"step_time": 8.843037704403105
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01640625,
"completions/max_length": 1997.3,
"completions/max_terminated_length": 1779.1,
"completions/mean_length": 217.213671875,
"completions/mean_terminated_length": 186.9976593017578,
"completions/min_length": 68.6,
"completions/min_terminated_length": 68.6,
"entropy": 0.09083101893775165,
"epoch": 5.289079229122056,
"frac_reward_zero_std": 0.83125,
"grad_norm": 0.3203125,
"learning_rate": 9.753100000000002e-06,
"loss": -0.0153,
"num_tokens": 276382057.0,
"reward": 1.025859385728836,
"reward_std": 0.24636052548885345,
"rewards/reward_accuracy/mean": 0.926953125,
"rewards/reward_accuracy/std": 0.2429162457585335,
"rewards/reward_format/mean": 0.09890625104308129,
"rewards/reward_format/std": 0.007459221687167883,
"sampling/importance_sampling_ratio/max": 2.4516578674316407,
"sampling/importance_sampling_ratio/mean": 0.9716264307498932,
"sampling/importance_sampling_ratio/min": 0.012272215075790882,
"sampling/sampling_logp_difference/max": 1.0119676351547242,
"sampling/sampling_logp_difference/mean": 0.005539378104731441,
"step": 2470,
"step_time": 9.71444490950089
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.017578125,
"completions/max_length": 1900.3,
"completions/max_terminated_length": 1678.3,
"completions/mean_length": 232.312890625,
"completions/mean_terminated_length": 199.92132110595702,
"completions/min_length": 70.3,
"completions/min_terminated_length": 70.3,
"entropy": 0.0939020378049463,
"epoch": 5.310492505353319,
"frac_reward_zero_std": 0.70625,
"grad_norm": 0.451171875,
"learning_rate": 9.752100000000001e-06,
"loss": -0.0141,
"num_tokens": 277494714.0,
"reward": 0.9915429770946502,
"reward_std": 0.30746877044439314,
"rewards/reward_accuracy/mean": 0.89296875,
"rewards/reward_accuracy/std": 0.303583887219429,
"rewards/reward_format/mean": 0.09857422187924385,
"rewards/reward_format/std": 0.009549545357003808,
"sampling/importance_sampling_ratio/max": 2.482248401641846,
"sampling/importance_sampling_ratio/mean": 0.9851887583732605,
"sampling/importance_sampling_ratio/min": 0.07260797461494803,
"sampling/sampling_logp_difference/max": 0.8355430841445923,
"sampling/sampling_logp_difference/mean": 0.005591252399608493,
"step": 2480,
"step_time": 9.207445373198425
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1743.3,
"completions/max_terminated_length": 1477.2,
"completions/mean_length": 199.64140625,
"completions/mean_terminated_length": 181.0130355834961,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.08241818873211741,
"epoch": 5.331905781584583,
"frac_reward_zero_std": 0.74375,
"grad_norm": 0.93359375,
"learning_rate": 9.7511e-06,
"loss": -0.006,
"num_tokens": 278519876.0,
"reward": 1.0007421910762786,
"reward_std": 0.27682340443134307,
"rewards/reward_accuracy/mean": 0.9015625,
"rewards/reward_accuracy/std": 0.2748535841703415,
"rewards/reward_format/mean": 0.09917968958616256,
"rewards/reward_format/std": 0.007045076694339514,
"sampling/importance_sampling_ratio/max": 2.4420810103416444,
"sampling/importance_sampling_ratio/mean": 0.9791848838329316,
"sampling/importance_sampling_ratio/min": 0.08354321867227554,
"sampling/sampling_logp_difference/max": 0.9599939584732056,
"sampling/sampling_logp_difference/mean": 0.0053884989582002165,
"step": 2490,
"step_time": 8.539123188298253
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01875,
"completions/max_length": 1789.6,
"completions/max_terminated_length": 1651.2,
"completions/mean_length": 234.3390625,
"completions/mean_terminated_length": 200.1589096069336,
"completions/min_length": 59.4,
"completions/min_terminated_length": 59.4,
"entropy": 0.10061342716217041,
"epoch": 5.353319057815845,
"frac_reward_zero_std": 0.7625,
"grad_norm": 0.373046875,
"learning_rate": 9.750100000000002e-06,
"loss": -0.0028,
"num_tokens": 279636760.0,
"reward": 0.9637109875679016,
"reward_std": 0.32122389078140257,
"rewards/reward_accuracy/mean": 0.865625,
"rewards/reward_accuracy/std": 0.3167167313396931,
"rewards/reward_format/mean": 0.09808593988418579,
"rewards/reward_format/std": 0.010564989317208529,
"sampling/importance_sampling_ratio/max": 2.6712836742401125,
"sampling/importance_sampling_ratio/mean": 0.9708147585391999,
"sampling/importance_sampling_ratio/min": 0.046273660846054554,
"sampling/sampling_logp_difference/max": 0.967151939868927,
"sampling/sampling_logp_difference/mean": 0.0057549459859728815,
"step": 2500,
"step_time": 9.220528620909317
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1842.8,
"completions/max_terminated_length": 1625.2,
"completions/mean_length": 194.065234375,
"completions/mean_terminated_length": 178.38196868896483,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.08608636278659106,
"epoch": 5.374732334047109,
"frac_reward_zero_std": 0.76875,
"grad_norm": 1.2109375,
"learning_rate": 9.749100000000001e-06,
"loss": -0.0079,
"num_tokens": 280658111.0,
"reward": 0.9937890827655792,
"reward_std": 0.2948853522539139,
"rewards/reward_accuracy/mean": 0.89453125,
"rewards/reward_accuracy/std": 0.2929905757308006,
"rewards/reward_format/mean": 0.09925781339406967,
"rewards/reward_format/std": 0.005207822169177234,
"sampling/importance_sampling_ratio/max": 2.5301826357841493,
"sampling/importance_sampling_ratio/mean": 0.9795863926410675,
"sampling/importance_sampling_ratio/min": 0.027811899781227112,
"sampling/sampling_logp_difference/max": 0.8700558423995972,
"sampling/sampling_logp_difference/mean": 0.005337479989975691,
"step": 2510,
"step_time": 8.902564639008778
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1799.1,
"completions/max_terminated_length": 1679.8,
"completions/mean_length": 205.376171875,
"completions/mean_terminated_length": 188.1674011230469,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.09191538309678435,
"epoch": 5.3961456102783725,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.4140625,
"learning_rate": 9.7481e-06,
"loss": -0.0119,
"num_tokens": 281698178.0,
"reward": 0.9920117497444153,
"reward_std": 0.27080377042293546,
"rewards/reward_accuracy/mean": 0.89296875,
"rewards/reward_accuracy/std": 0.26855465918779375,
"rewards/reward_format/mean": 0.09904297292232514,
"rewards/reward_format/std": 0.006599341426044703,
"sampling/importance_sampling_ratio/max": 2.5970534086227417,
"sampling/importance_sampling_ratio/mean": 0.9854391098022461,
"sampling/importance_sampling_ratio/min": 0.007531091384589672,
"sampling/sampling_logp_difference/max": 0.834945660829544,
"sampling/sampling_logp_difference/mean": 0.005591524625197053,
"step": 2520,
"step_time": 8.595116329092708
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1735.9,
"completions/max_terminated_length": 1637.9,
"completions/mean_length": 187.39140625,
"completions/mean_terminated_length": 174.3029022216797,
"completions/min_length": 68.9,
"completions/min_terminated_length": 68.9,
"entropy": 0.0772474714089185,
"epoch": 5.417558886509636,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.61328125,
"learning_rate": 9.7471e-06,
"loss": -0.0161,
"num_tokens": 282694876.0,
"reward": 1.0240429759025573,
"reward_std": 0.251837544888258,
"rewards/reward_accuracy/mean": 0.924609375,
"rewards/reward_accuracy/std": 0.25009947791695597,
"rewards/reward_format/mean": 0.09943359568715096,
"rewards/reward_format/std": 0.00541020801756531,
"sampling/importance_sampling_ratio/max": 2.475125956535339,
"sampling/importance_sampling_ratio/mean": 0.9813670516014099,
"sampling/importance_sampling_ratio/min": 0.054774162173271176,
"sampling/sampling_logp_difference/max": 0.9002179741859436,
"sampling/sampling_logp_difference/mean": 0.005192521540448069,
"step": 2530,
"step_time": 8.426920094103844
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1651.1,
"completions/max_terminated_length": 1570.6,
"completions/mean_length": 230.132421875,
"completions/mean_terminated_length": 217.63737030029296,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.10376953086815774,
"epoch": 5.4389721627409,
"frac_reward_zero_std": 0.70625,
"grad_norm": 0.57421875,
"learning_rate": 9.7461e-06,
"loss": -0.0172,
"num_tokens": 283801711.0,
"reward": 0.9813867449760437,
"reward_std": 0.301180063188076,
"rewards/reward_accuracy/mean": 0.88203125,
"rewards/reward_accuracy/std": 0.29986003786325455,
"rewards/reward_format/mean": 0.09935546964406967,
"rewards/reward_format/std": 0.0049929341301321985,
"sampling/importance_sampling_ratio/max": 2.4947921514511107,
"sampling/importance_sampling_ratio/mean": 0.9611072242259979,
"sampling/importance_sampling_ratio/min": 0.018612132966518403,
"sampling/sampling_logp_difference/max": 1.2309057414531708,
"sampling/sampling_logp_difference/mean": 0.005937679437920451,
"step": 2540,
"step_time": 8.104182049307564
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.017578125,
"completions/max_length": 2038.5,
"completions/max_terminated_length": 1672.4,
"completions/mean_length": 234.178515625,
"completions/mean_terminated_length": 202.1281478881836,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.10917196283116937,
"epoch": 5.460385438972163,
"frac_reward_zero_std": 0.6875,
"grad_norm": 0.87109375,
"learning_rate": 9.745100000000001e-06,
"loss": -0.0079,
"num_tokens": 284924200.0,
"reward": 0.9614257991313935,
"reward_std": 0.33641075938940046,
"rewards/reward_accuracy/mean": 0.862890625,
"rewards/reward_accuracy/std": 0.33284653425216676,
"rewards/reward_format/mean": 0.09853515774011612,
"rewards/reward_format/std": 0.00988441458903253,
"sampling/importance_sampling_ratio/max": 2.538672590255737,
"sampling/importance_sampling_ratio/mean": 0.9728983044624329,
"sampling/importance_sampling_ratio/min": 0.011781583679839969,
"sampling/sampling_logp_difference/max": 0.810519564151764,
"sampling/sampling_logp_difference/mean": 0.006139705702662468,
"step": 2550,
"step_time": 10.073733042093227
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1742.8,
"completions/max_terminated_length": 1627.9,
"completions/mean_length": 198.883203125,
"completions/mean_terminated_length": 175.80145263671875,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"entropy": 0.08599213841371238,
"epoch": 5.481798715203426,
"frac_reward_zero_std": 0.78125,
"grad_norm": 0.7265625,
"learning_rate": 9.7441e-06,
"loss": -0.0072,
"num_tokens": 285948461.0,
"reward": 1.0166015684604646,
"reward_std": 0.2464704230427742,
"rewards/reward_accuracy/mean": 0.917578125,
"rewards/reward_accuracy/std": 0.24380334466695786,
"rewards/reward_format/mean": 0.0990234375,
"rewards/reward_format/std": 0.006978190480731427,
"sampling/importance_sampling_ratio/max": 2.541829991340637,
"sampling/importance_sampling_ratio/mean": 0.9823161542415619,
"sampling/importance_sampling_ratio/min": 0.13005999280139804,
"sampling/sampling_logp_difference/max": 0.9425640225410461,
"sampling/sampling_logp_difference/mean": 0.005421636952087283,
"step": 2560,
"step_time": 8.459235480193456
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.010546875,
"completions/max_length": 1786.5,
"completions/max_terminated_length": 1401.2,
"completions/mean_length": 178.33984375,
"completions/mean_terminated_length": 158.5232276916504,
"completions/min_length": 65.2,
"completions/min_terminated_length": 65.2,
"entropy": 0.08022891581058503,
"epoch": 5.503211991434689,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.46875,
"learning_rate": 9.743100000000002e-06,
"loss": -0.0131,
"num_tokens": 286920467.0,
"reward": 1.0317578554153441,
"reward_std": 0.2322593189775944,
"rewards/reward_accuracy/mean": 0.9328125,
"rewards/reward_accuracy/std": 0.22773384675383568,
"rewards/reward_format/mean": 0.09894531369209289,
"rewards/reward_format/std": 0.008071540668606759,
"sampling/importance_sampling_ratio/max": 2.481596660614014,
"sampling/importance_sampling_ratio/mean": 0.9842998325824738,
"sampling/importance_sampling_ratio/min": 0.0459027617238462,
"sampling/sampling_logp_difference/max": 0.9357318758964539,
"sampling/sampling_logp_difference/mean": 0.00537831773981452,
"step": 2570,
"step_time": 8.46746215049934
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012890625,
"completions/max_length": 1957.7,
"completions/max_terminated_length": 1653.3,
"completions/mean_length": 216.055859375,
"completions/mean_terminated_length": 192.2252990722656,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.09719385197386146,
"epoch": 5.524625267665953,
"frac_reward_zero_std": 0.725,
"grad_norm": 0.51171875,
"learning_rate": 9.742100000000001e-06,
"loss": -0.0202,
"num_tokens": 287995890.0,
"reward": 0.9928125202655792,
"reward_std": 0.3024392515420914,
"rewards/reward_accuracy/mean": 0.89375,
"rewards/reward_accuracy/std": 0.2997848495841026,
"rewards/reward_format/mean": 0.09906250238418579,
"rewards/reward_format/std": 0.007458717399276793,
"sampling/importance_sampling_ratio/max": 2.536896014213562,
"sampling/importance_sampling_ratio/mean": 0.9808107197284699,
"sampling/importance_sampling_ratio/min": 0.025978675112128258,
"sampling/sampling_logp_difference/max": 0.9401902914047241,
"sampling/sampling_logp_difference/mean": 0.0058117176871746775,
"step": 2580,
"step_time": 9.604288336297031
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1812.6,
"completions/max_terminated_length": 1656.2,
"completions/mean_length": 203.5859375,
"completions/mean_terminated_length": 185.5386505126953,
"completions/min_length": 62.2,
"completions/min_terminated_length": 62.2,
"entropy": 0.0970848260447383,
"epoch": 5.546038543897216,
"frac_reward_zero_std": 0.725,
"grad_norm": 1.484375,
"learning_rate": 9.7411e-06,
"loss": -0.0178,
"num_tokens": 289037166.0,
"reward": 0.9865234792232513,
"reward_std": 0.3147984743118286,
"rewards/reward_accuracy/mean": 0.8875,
"rewards/reward_accuracy/std": 0.31200769543647766,
"rewards/reward_format/mean": 0.09902343824505806,
"rewards/reward_format/std": 0.0073063039453700185,
"sampling/importance_sampling_ratio/max": 2.331999945640564,
"sampling/importance_sampling_ratio/mean": 0.9674416601657867,
"sampling/importance_sampling_ratio/min": 0.06343612056225538,
"sampling/sampling_logp_difference/max": 0.7621833324432373,
"sampling/sampling_logp_difference/mean": 0.005738088767975569,
"step": 2590,
"step_time": 8.791197411001486
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01640625,
"completions/max_length": 2040.6,
"completions/max_terminated_length": 1786.7,
"completions/mean_length": 222.503125,
"completions/mean_terminated_length": 192.2262390136719,
"completions/min_length": 59.9,
"completions/min_terminated_length": 59.9,
"entropy": 0.09692373019643127,
"epoch": 5.56745182012848,
"frac_reward_zero_std": 0.69375,
"grad_norm": 0.396484375,
"learning_rate": 9.740100000000002e-06,
"loss": -0.0128,
"num_tokens": 290136438.0,
"reward": 0.9710937798023224,
"reward_std": 0.32278500497341156,
"rewards/reward_accuracy/mean": 0.87265625,
"rewards/reward_accuracy/std": 0.3186033122241497,
"rewards/reward_format/mean": 0.0984375,
"rewards/reward_format/std": 0.009687871881760656,
"sampling/importance_sampling_ratio/max": 2.5795541048049926,
"sampling/importance_sampling_ratio/mean": 0.9700413227081299,
"sampling/importance_sampling_ratio/min": 0.03474186845123768,
"sampling/sampling_logp_difference/max": 1.2038312673568725,
"sampling/sampling_logp_difference/mean": 0.005521287745796144,
"step": 2600,
"step_time": 10.160681416199077
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1827.7,
"completions/max_terminated_length": 1695.7,
"completions/mean_length": 195.54453125,
"completions/mean_terminated_length": 178.90796661376953,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.08741520689800382,
"epoch": 5.5888650963597435,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.70703125,
"learning_rate": 9.739100000000001e-06,
"loss": -0.0061,
"num_tokens": 291153256.0,
"reward": 1.0175781190395354,
"reward_std": 0.26622320115566256,
"rewards/reward_accuracy/mean": 0.918359375,
"rewards/reward_accuracy/std": 0.2637049689888954,
"rewards/reward_format/mean": 0.09921874925494194,
"rewards/reward_format/std": 0.0058366016484797,
"sampling/importance_sampling_ratio/max": 2.3926997900009157,
"sampling/importance_sampling_ratio/mean": 0.9848893523216248,
"sampling/importance_sampling_ratio/min": 0.03639995865523815,
"sampling/sampling_logp_difference/max": 0.9070591747760772,
"sampling/sampling_logp_difference/mean": 0.005209387792274356,
"step": 2610,
"step_time": 8.954066406497441
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1853.8,
"completions/max_terminated_length": 1588.2,
"completions/mean_length": 187.43359375,
"completions/mean_terminated_length": 172.84810485839844,
"completions/min_length": 62.4,
"completions/min_terminated_length": 62.4,
"entropy": 0.08009823095053434,
"epoch": 5.610278372591006,
"frac_reward_zero_std": 0.76875,
"grad_norm": 0.396484375,
"learning_rate": 9.7381e-06,
"loss": -0.0054,
"num_tokens": 292151630.0,
"reward": 0.9963086128234864,
"reward_std": 0.26927749067544937,
"rewards/reward_accuracy/mean": 0.896875,
"rewards/reward_accuracy/std": 0.2675220414996147,
"rewards/reward_format/mean": 0.09943359419703483,
"rewards/reward_format/std": 0.005424888757988811,
"sampling/importance_sampling_ratio/max": 2.4646893739700317,
"sampling/importance_sampling_ratio/mean": 0.9980157017707825,
"sampling/importance_sampling_ratio/min": 0.03820842653512955,
"sampling/sampling_logp_difference/max": 1.2514472365379334,
"sampling/sampling_logp_difference/mean": 0.004921606439165771,
"step": 2620,
"step_time": 9.07707772279682
},
{
"clip_ratio/high_max": 1.8879036360885948e-05,
"clip_ratio/high_mean": 2.3598795451107435e-06,
"clip_ratio/low_mean": 9.786012924450915e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.338480837555835e-06,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1823.9,
"completions/max_terminated_length": 1741.0,
"completions/mean_length": 216.0703125,
"completions/mean_terminated_length": 204.51573791503907,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"entropy": 0.0952657591085881,
"epoch": 5.63169164882227,
"frac_reward_zero_std": 0.70625,
"grad_norm": 0.78125,
"learning_rate": 9.7371e-06,
"loss": -0.0139,
"num_tokens": 293234562.0,
"reward": 0.9615820586681366,
"reward_std": 0.33059417456388474,
"rewards/reward_accuracy/mean": 0.862109375,
"rewards/reward_accuracy/std": 0.32923930436372756,
"rewards/reward_format/mean": 0.0994726575911045,
"rewards/reward_format/std": 0.004763867682777345,
"sampling/importance_sampling_ratio/max": 2.6706831216812135,
"sampling/importance_sampling_ratio/mean": 0.9762564897537231,
"sampling/importance_sampling_ratio/min": 0.022373689617961646,
"sampling/sampling_logp_difference/max": 0.9054080367088317,
"sampling/sampling_logp_difference/mean": 0.005518699856474995,
"step": 2630,
"step_time": 8.82820610140043
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1849.8,
"completions/max_terminated_length": 1617.7,
"completions/mean_length": 184.731640625,
"completions/mean_terminated_length": 178.20914459228516,
"completions/min_length": 58.5,
"completions/min_terminated_length": 58.5,
"entropy": 0.08519844254478812,
"epoch": 5.653104925053533,
"frac_reward_zero_std": 0.73125,
"grad_norm": 0.89453125,
"learning_rate": 9.7361e-06,
"loss": -0.005,
"num_tokens": 294225539.0,
"reward": 1.0011132895946502,
"reward_std": 0.2899130553007126,
"rewards/reward_accuracy/mean": 0.9015625,
"rewards/reward_accuracy/std": 0.2889107473194599,
"rewards/reward_format/mean": 0.09955078288912773,
"rewards/reward_format/std": 0.00413353533949703,
"sampling/importance_sampling_ratio/max": 2.5385457992553713,
"sampling/importance_sampling_ratio/mean": 0.9848312973976135,
"sampling/importance_sampling_ratio/min": 0.09583455622196198,
"sampling/sampling_logp_difference/max": 0.8406406939029694,
"sampling/sampling_logp_difference/mean": 0.005368578666821122,
"step": 2640,
"step_time": 8.72892038791033
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1895.4,
"completions/max_terminated_length": 1720.8,
"completions/mean_length": 213.431640625,
"completions/mean_terminated_length": 199.83561096191406,
"completions/min_length": 68.6,
"completions/min_terminated_length": 68.6,
"entropy": 0.09950822219252586,
"epoch": 5.674518201284797,
"frac_reward_zero_std": 0.74375,
"grad_norm": 0.4453125,
"learning_rate": 9.735100000000001e-06,
"loss": -0.0158,
"num_tokens": 295290868.0,
"reward": 1.008847677707672,
"reward_std": 0.27433363199234007,
"rewards/reward_accuracy/mean": 0.909765625,
"rewards/reward_accuracy/std": 0.2721190631389618,
"rewards/reward_format/mean": 0.09908203184604644,
"rewards/reward_format/std": 0.006449411879293621,
"sampling/importance_sampling_ratio/max": 2.4895023822784426,
"sampling/importance_sampling_ratio/mean": 0.9796148240566254,
"sampling/importance_sampling_ratio/min": 0.07677715606987476,
"sampling/sampling_logp_difference/max": 0.9414615988731384,
"sampling/sampling_logp_difference/mean": 0.005770316999405623,
"step": 2650,
"step_time": 9.045770299504511
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1800.2,
"completions/max_terminated_length": 1520.4,
"completions/mean_length": 203.009375,
"completions/mean_terminated_length": 185.83713073730468,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.09497263934463263,
"epoch": 5.69593147751606,
"frac_reward_zero_std": 0.7375,
"grad_norm": 0.7734375,
"learning_rate": 9.7341e-06,
"loss": -0.0086,
"num_tokens": 296320604.0,
"reward": 1.0032422065734863,
"reward_std": 0.28134241998195647,
"rewards/reward_accuracy/mean": 0.90390625,
"rewards/reward_accuracy/std": 0.2799342915415764,
"rewards/reward_format/mean": 0.09933593943715095,
"rewards/reward_format/std": 0.004984128312207759,
"sampling/importance_sampling_ratio/max": 2.487820625305176,
"sampling/importance_sampling_ratio/mean": 0.986012476682663,
"sampling/importance_sampling_ratio/min": 0.0534177303314209,
"sampling/sampling_logp_difference/max": 0.7051383316516876,
"sampling/sampling_logp_difference/mean": 0.005373080633580685,
"step": 2660,
"step_time": 8.665925271392917
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1866.5,
"completions/max_terminated_length": 1603.4,
"completions/mean_length": 190.236328125,
"completions/mean_terminated_length": 175.64409332275392,
"completions/min_length": 61.6,
"completions/min_terminated_length": 61.6,
"entropy": 0.08649002499878407,
"epoch": 5.717344753747323,
"frac_reward_zero_std": 0.76875,
"grad_norm": 0.123046875,
"learning_rate": 9.7331e-06,
"loss": -0.0074,
"num_tokens": 297323689.0,
"reward": 1.0013281404972076,
"reward_std": 0.2919479012489319,
"rewards/reward_accuracy/mean": 0.901953125,
"rewards/reward_accuracy/std": 0.2900006607174873,
"rewards/reward_format/mean": 0.09937500134110451,
"rewards/reward_format/std": 0.006024126685224474,
"sampling/importance_sampling_ratio/max": 2.402226674556732,
"sampling/importance_sampling_ratio/mean": 0.9743847072124481,
"sampling/importance_sampling_ratio/min": 0.053485245816409586,
"sampling/sampling_logp_difference/max": 1.3002052307128906,
"sampling/sampling_logp_difference/mean": 0.005210312874987721,
"step": 2670,
"step_time": 8.995565101402462
},
{
"clip_ratio/high_max": 4.4307541247690094e-05,
"clip_ratio/high_mean": 5.538442655961262e-06,
"clip_ratio/low_mean": 1.9073486328125e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 5.729177519242512e-06,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1669.0,
"completions/max_terminated_length": 1545.6,
"completions/mean_length": 187.403515625,
"completions/mean_terminated_length": 163.9881607055664,
"completions/min_length": 63.7,
"completions/min_terminated_length": 63.7,
"entropy": 0.08572275168262422,
"epoch": 5.7387580299785865,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.72265625,
"learning_rate": 9.732100000000001e-06,
"loss": -0.0059,
"num_tokens": 298320706.0,
"reward": 1.007207053899765,
"reward_std": 0.27186974659562113,
"rewards/reward_accuracy/mean": 0.908203125,
"rewards/reward_accuracy/std": 0.26894130632281305,
"rewards/reward_format/mean": 0.09900390654802323,
"rewards/reward_format/std": 0.0076935971854254605,
"sampling/importance_sampling_ratio/max": 2.6095290303230287,
"sampling/importance_sampling_ratio/mean": 0.9823377013206482,
"sampling/importance_sampling_ratio/min": 0.0978566437959671,
"sampling/sampling_logp_difference/max": 0.9193890929222107,
"sampling/sampling_logp_difference/mean": 0.0053225263021886345,
"step": 2680,
"step_time": 8.323083648098692
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01328125,
"completions/max_length": 1952.6,
"completions/max_terminated_length": 1756.3,
"completions/mean_length": 219.91953125,
"completions/mean_terminated_length": 195.5892364501953,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.10326898656785488,
"epoch": 5.76017130620985,
"frac_reward_zero_std": 0.73125,
"grad_norm": 0.71484375,
"learning_rate": 9.7311e-06,
"loss": -0.01,
"num_tokens": 299402900.0,
"reward": 1.002207064628601,
"reward_std": 0.2819762319326401,
"rewards/reward_accuracy/mean": 0.903125,
"rewards/reward_accuracy/std": 0.2792808972299099,
"rewards/reward_format/mean": 0.09908203333616257,
"rewards/reward_format/std": 0.007749258819967508,
"sampling/importance_sampling_ratio/max": 2.406766891479492,
"sampling/importance_sampling_ratio/mean": 0.9658811807632446,
"sampling/importance_sampling_ratio/min": 0.015211740881204605,
"sampling/sampling_logp_difference/max": 1.0349429905414582,
"sampling/sampling_logp_difference/mean": 0.0058912438806146385,
"step": 2690,
"step_time": 9.630869079503464
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 2016.1,
"completions/max_terminated_length": 1741.7,
"completions/mean_length": 215.04609375,
"completions/mean_terminated_length": 197.0232955932617,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.10113042816519738,
"epoch": 5.781584582441114,
"frac_reward_zero_std": 0.7,
"grad_norm": 0.71875,
"learning_rate": 9.730100000000002e-06,
"loss": -0.0137,
"num_tokens": 300474906.0,
"reward": 0.9857812762260437,
"reward_std": 0.3068300724029541,
"rewards/reward_accuracy/mean": 0.88671875,
"rewards/reward_accuracy/std": 0.30419197082519533,
"rewards/reward_format/mean": 0.09906250238418579,
"rewards/reward_format/std": 0.007088403753004968,
"sampling/importance_sampling_ratio/max": 2.531329846382141,
"sampling/importance_sampling_ratio/mean": 0.9763480663299561,
"sampling/importance_sampling_ratio/min": 0.06635606586933136,
"sampling/sampling_logp_difference/max": 1.2299103140830994,
"sampling/sampling_logp_difference/mean": 0.00579431070946157,
"step": 2700,
"step_time": 9.672197978314944
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.03170643797057e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.03170643797057e-06,
"completions/clipped_ratio": 0.023046875,
"completions/max_length": 1867.7,
"completions/max_terminated_length": 1716.2,
"completions/mean_length": 251.282421875,
"completions/mean_terminated_length": 209.52586059570314,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.12002571318298579,
"epoch": 5.802997858672377,
"frac_reward_zero_std": 0.70625,
"grad_norm": 0.7109375,
"learning_rate": 9.729100000000001e-06,
"loss": -0.0129,
"num_tokens": 301636045.0,
"reward": 0.9997265815734864,
"reward_std": 0.28617083206772803,
"rewards/reward_accuracy/mean": 0.9015625,
"rewards/reward_accuracy/std": 0.2814148776233196,
"rewards/reward_format/mean": 0.09816406518220902,
"rewards/reward_format/std": 0.010173438489437104,
"sampling/importance_sampling_ratio/max": 2.570566785335541,
"sampling/importance_sampling_ratio/mean": 0.9685573756694794,
"sampling/importance_sampling_ratio/min": 0.04660218954086304,
"sampling/sampling_logp_difference/max": 1.058223044872284,
"sampling/sampling_logp_difference/mean": 0.006257775123231113,
"step": 2710,
"step_time": 9.417109500998048
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 7.837616749384324e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 7.837616749384324e-07,
"completions/clipped_ratio": 0.019140625,
"completions/max_length": 1812.9,
"completions/max_terminated_length": 1788.1,
"completions/mean_length": 240.292578125,
"completions/mean_terminated_length": 205.55127563476563,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.10262494324706495,
"epoch": 5.82441113490364,
"frac_reward_zero_std": 0.7,
"grad_norm": 0.43359375,
"learning_rate": 9.728100000000001e-06,
"loss": -0.024,
"num_tokens": 302773402.0,
"reward": 0.9881445527076721,
"reward_std": 0.2955147482454777,
"rewards/reward_accuracy/mean": 0.88984375,
"rewards/reward_accuracy/std": 0.29142174795269965,
"rewards/reward_format/mean": 0.0983007825911045,
"rewards/reward_format/std": 0.009617170714773238,
"sampling/importance_sampling_ratio/max": 2.3676090359687807,
"sampling/importance_sampling_ratio/mean": 0.9669629454612731,
"sampling/importance_sampling_ratio/min": 0.10330686569213868,
"sampling/sampling_logp_difference/max": 1.0386144638061523,
"sampling/sampling_logp_difference/mean": 0.005520481616258621,
"step": 2720,
"step_time": 9.353399847786932
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1908.3,
"completions/max_terminated_length": 1668.9,
"completions/mean_length": 194.985546875,
"completions/mean_terminated_length": 182.74673461914062,
"completions/min_length": 68.3,
"completions/min_terminated_length": 68.3,
"entropy": 0.08835489409975708,
"epoch": 5.845824411134903,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.68359375,
"learning_rate": 9.7271e-06,
"loss": -0.0016,
"num_tokens": 303786709.0,
"reward": 1.015703147649765,
"reward_std": 0.259984889626503,
"rewards/reward_accuracy/mean": 0.91640625,
"rewards/reward_accuracy/std": 0.257868666946888,
"rewards/reward_format/mean": 0.09929687604308128,
"rewards/reward_format/std": 0.006227575219236314,
"sampling/importance_sampling_ratio/max": 2.476009893417358,
"sampling/importance_sampling_ratio/mean": 0.9803802669048309,
"sampling/importance_sampling_ratio/min": 0.07707422468811273,
"sampling/sampling_logp_difference/max": 0.9398271322250367,
"sampling/sampling_logp_difference/mean": 0.005508575914427638,
"step": 2730,
"step_time": 9.026170331594766
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1727.2,
"completions/max_terminated_length": 1570.0,
"completions/mean_length": 218.164453125,
"completions/mean_terminated_length": 195.6148880004883,
"completions/min_length": 68.8,
"completions/min_terminated_length": 68.8,
"entropy": 0.08793371603824199,
"epoch": 5.867237687366167,
"frac_reward_zero_std": 0.7375,
"grad_norm": 0.392578125,
"learning_rate": 9.7261e-06,
"loss": -0.0093,
"num_tokens": 304865866.0,
"reward": 0.9598633110523224,
"reward_std": 0.3291732981801033,
"rewards/reward_accuracy/mean": 0.8609375,
"rewards/reward_accuracy/std": 0.3268049731850624,
"rewards/reward_format/mean": 0.09892578274011612,
"rewards/reward_format/std": 0.00729636000469327,
"sampling/importance_sampling_ratio/max": 2.414112186431885,
"sampling/importance_sampling_ratio/mean": 0.9755020320415497,
"sampling/importance_sampling_ratio/min": 0.04084041332826018,
"sampling/sampling_logp_difference/max": 0.8150185763835907,
"sampling/sampling_logp_difference/mean": 0.005145572056062519,
"step": 2740,
"step_time": 8.501146585401148
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1703.5,
"completions/max_terminated_length": 1552.7,
"completions/mean_length": 195.409765625,
"completions/mean_terminated_length": 178.952294921875,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.09043916640803218,
"epoch": 5.8886509635974305,
"frac_reward_zero_std": 0.7625,
"grad_norm": 0.73046875,
"learning_rate": 9.725100000000001e-06,
"loss": -0.0068,
"num_tokens": 305882851.0,
"reward": 0.9727930128574371,
"reward_std": 0.32007398158311845,
"rewards/reward_accuracy/mean": 0.8734375,
"rewards/reward_accuracy/std": 0.31838304102420806,
"rewards/reward_format/mean": 0.09935547187924385,
"rewards/reward_format/std": 0.005791616556234658,
"sampling/importance_sampling_ratio/max": 2.4234368205070496,
"sampling/importance_sampling_ratio/mean": 0.9769808411598205,
"sampling/importance_sampling_ratio/min": 0.04629259556531906,
"sampling/sampling_logp_difference/max": 0.9090433537960052,
"sampling/sampling_logp_difference/mean": 0.0054946182761341335,
"step": 2750,
"step_time": 8.218995348390308
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1359.0,
"completions/max_terminated_length": 1044.5,
"completions/mean_length": 157.68671875,
"completions/mean_terminated_length": 151.06021270751953,
"completions/min_length": 62.9,
"completions/min_terminated_length": 62.9,
"entropy": 0.06947674732655287,
"epoch": 5.910064239828694,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.54296875,
"learning_rate": 9.7241e-06,
"loss": -0.0051,
"num_tokens": 306795281.0,
"reward": 1.0434570550918578,
"reward_std": 0.20571643263101577,
"rewards/reward_accuracy/mean": 0.94375,
"rewards/reward_accuracy/std": 0.20445231422781945,
"rewards/reward_format/mean": 0.09970703348517418,
"rewards/reward_format/std": 0.0032039214624091984,
"sampling/importance_sampling_ratio/max": 2.3015694499015806,
"sampling/importance_sampling_ratio/mean": 0.9865372478961945,
"sampling/importance_sampling_ratio/min": 0.1537468396127224,
"sampling/sampling_logp_difference/max": 0.7713847041130066,
"sampling/sampling_logp_difference/mean": 0.0049192477250471715,
"step": 2760,
"step_time": 6.571827376188594
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1866.6,
"completions/max_terminated_length": 1579.6,
"completions/mean_length": 209.9953125,
"completions/mean_terminated_length": 191.96138763427734,
"completions/min_length": 70.2,
"completions/min_terminated_length": 70.2,
"entropy": 0.08696014727465809,
"epoch": 5.9314775160599575,
"frac_reward_zero_std": 0.75625,
"grad_norm": 0.609375,
"learning_rate": 9.7231e-06,
"loss": -0.011,
"num_tokens": 307855045.0,
"reward": 0.9837109565734863,
"reward_std": 0.31193709671497344,
"rewards/reward_accuracy/mean": 0.884765625,
"rewards/reward_accuracy/std": 0.3091201469302177,
"rewards/reward_format/mean": 0.09894531443715096,
"rewards/reward_format/std": 0.00809910970274359,
"sampling/importance_sampling_ratio/max": 2.5305423974990844,
"sampling/importance_sampling_ratio/mean": 0.9768745005130768,
"sampling/importance_sampling_ratio/min": 0.04695873968303203,
"sampling/sampling_logp_difference/max": 0.8456750392913819,
"sampling/sampling_logp_difference/mean": 0.005190486274659634,
"step": 2770,
"step_time": 9.275050118802756
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1745.2,
"completions/max_terminated_length": 1555.1,
"completions/mean_length": 183.61953125,
"completions/mean_terminated_length": 174.16790771484375,
"completions/min_length": 63.9,
"completions/min_terminated_length": 63.9,
"entropy": 0.08099756077863277,
"epoch": 5.95289079229122,
"frac_reward_zero_std": 0.7875,
"grad_norm": 0.37890625,
"learning_rate": 9.722100000000001e-06,
"loss": -0.012,
"num_tokens": 308844311.0,
"reward": 1.016992199420929,
"reward_std": 0.25884916484355924,
"rewards/reward_accuracy/mean": 0.917578125,
"rewards/reward_accuracy/std": 0.25712950974702836,
"rewards/reward_format/mean": 0.09941406399011612,
"rewards/reward_format/std": 0.005844208225607872,
"sampling/importance_sampling_ratio/max": 2.4151711106300353,
"sampling/importance_sampling_ratio/mean": 0.9781522989273072,
"sampling/importance_sampling_ratio/min": 0.06056961491703987,
"sampling/sampling_logp_difference/max": 0.8325577259063721,
"sampling/sampling_logp_difference/mean": 0.005159343779087067,
"step": 2780,
"step_time": 8.222840421898582
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1798.2,
"completions/max_terminated_length": 1686.0,
"completions/mean_length": 192.316796875,
"completions/mean_terminated_length": 169.30235443115234,
"completions/min_length": 62.6,
"completions/min_terminated_length": 62.6,
"entropy": 0.08877780083566904,
"epoch": 5.974304068522484,
"frac_reward_zero_std": 0.80625,
"grad_norm": 0.7890625,
"learning_rate": 9.7211e-06,
"loss": -0.0144,
"num_tokens": 309856498.0,
"reward": 1.0087500274181367,
"reward_std": 0.2585681900382042,
"rewards/reward_accuracy/mean": 0.91015625,
"rewards/reward_accuracy/std": 0.25492620915174485,
"rewards/reward_format/mean": 0.09859374985098839,
"rewards/reward_format/std": 0.007549750967882574,
"sampling/importance_sampling_ratio/max": 2.4500788927078245,
"sampling/importance_sampling_ratio/mean": 0.9811334669589996,
"sampling/importance_sampling_ratio/min": 0.06761603087652475,
"sampling/sampling_logp_difference/max": 1.2189803659915923,
"sampling/sampling_logp_difference/mean": 0.005356675689108669,
"step": 2790,
"step_time": 8.811681783587847
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1663.3,
"completions/max_terminated_length": 1564.5,
"completions/mean_length": 192.715234375,
"completions/mean_terminated_length": 174.90528869628906,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.08434950122609734,
"epoch": 5.995717344753747,
"frac_reward_zero_std": 0.7625,
"grad_norm": 0.87109375,
"learning_rate": 9.720100000000002e-06,
"loss": -0.0107,
"num_tokens": 310870073.0,
"reward": 0.9884765684604645,
"reward_std": 0.2944615542888641,
"rewards/reward_accuracy/mean": 0.889453125,
"rewards/reward_accuracy/std": 0.29229392409324645,
"rewards/reward_format/mean": 0.09902343824505806,
"rewards/reward_format/std": 0.006411656108684838,
"sampling/importance_sampling_ratio/max": 2.519631505012512,
"sampling/importance_sampling_ratio/mean": 0.9803213715553284,
"sampling/importance_sampling_ratio/min": 0.07371208891272545,
"sampling/sampling_logp_difference/max": 0.8021101295948029,
"sampling/sampling_logp_difference/mean": 0.004965496808290481,
"step": 2800,
"step_time": 8.106259362892889
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1834.8,
"completions/max_terminated_length": 1687.3,
"completions/mean_length": 193.93515625,
"completions/mean_terminated_length": 180.9973937988281,
"completions/min_length": 62.6,
"completions/min_terminated_length": 62.6,
"entropy": 0.08469535945914686,
"epoch": 6.017130620985011,
"frac_reward_zero_std": 0.75625,
"grad_norm": 0.70703125,
"learning_rate": 9.719100000000002e-06,
"loss": -0.0029,
"num_tokens": 311873075.0,
"reward": 1.0174219012260437,
"reward_std": 0.24946171492338182,
"rewards/reward_accuracy/mean": 0.918359375,
"rewards/reward_accuracy/std": 0.2466511346399784,
"rewards/reward_format/mean": 0.09906250163912773,
"rewards/reward_format/std": 0.007257556752301752,
"sampling/importance_sampling_ratio/max": 2.4026358366012572,
"sampling/importance_sampling_ratio/mean": 0.9755026876926423,
"sampling/importance_sampling_ratio/min": 0.07956723347306252,
"sampling/sampling_logp_difference/max": 0.7643571257591247,
"sampling/sampling_logp_difference/mean": 0.0051665655337274075,
"step": 2810,
"step_time": 8.877127829896926
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1808.6,
"completions/max_terminated_length": 1735.3,
"completions/mean_length": 181.459765625,
"completions/mean_terminated_length": 169.8672866821289,
"completions/min_length": 61.2,
"completions/min_terminated_length": 61.2,
"entropy": 0.08132383790798485,
"epoch": 6.038543897216274,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.06787109375,
"learning_rate": 9.718100000000001e-06,
"loss": -0.008,
"num_tokens": 312859148.0,
"reward": 1.0190039277076721,
"reward_std": 0.2510433577001095,
"rewards/reward_accuracy/mean": 0.91953125,
"rewards/reward_accuracy/std": 0.2495570458471775,
"rewards/reward_format/mean": 0.0994726575911045,
"rewards/reward_format/std": 0.00453657484613359,
"sampling/importance_sampling_ratio/max": 2.4402728915214538,
"sampling/importance_sampling_ratio/mean": 0.9837861478328704,
"sampling/importance_sampling_ratio/min": 0.04190096118254587,
"sampling/sampling_logp_difference/max": 0.8958397626876831,
"sampling/sampling_logp_difference/mean": 0.005144820176064968,
"step": 2820,
"step_time": 8.582439180402435
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1641.9,
"completions/max_terminated_length": 1557.4,
"completions/mean_length": 213.02421875,
"completions/mean_terminated_length": 199.55803985595702,
"completions/min_length": 61.5,
"completions/min_terminated_length": 61.5,
"entropy": 0.09837138229049742,
"epoch": 6.059957173447537,
"frac_reward_zero_std": 0.76875,
"grad_norm": 0.47265625,
"learning_rate": 9.7171e-06,
"loss": -0.0078,
"num_tokens": 313923338.0,
"reward": 0.9683789193630219,
"reward_std": 0.32717630118131635,
"rewards/reward_accuracy/mean": 0.869140625,
"rewards/reward_accuracy/std": 0.3253849372267723,
"rewards/reward_format/mean": 0.0992382824420929,
"rewards/reward_format/std": 0.0062909832457080485,
"sampling/importance_sampling_ratio/max": 2.5425549745559692,
"sampling/importance_sampling_ratio/mean": 0.9610412538051605,
"sampling/importance_sampling_ratio/min": 0.11924933649133891,
"sampling/sampling_logp_difference/max": 1.4009202480316163,
"sampling/sampling_logp_difference/mean": 0.00554663366638124,
"step": 2830,
"step_time": 8.173756646901893
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1633.6,
"completions/max_terminated_length": 1390.8,
"completions/mean_length": 177.324609375,
"completions/mean_terminated_length": 165.00167846679688,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.08392819142900407,
"epoch": 6.081370449678801,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.55078125,
"learning_rate": 9.7161e-06,
"loss": -0.0111,
"num_tokens": 314898073.0,
"reward": 1.0330273509025574,
"reward_std": 0.2332446202635765,
"rewards/reward_accuracy/mean": 0.93359375,
"rewards/reward_accuracy/std": 0.2316140852868557,
"rewards/reward_format/mean": 0.09943359494209289,
"rewards/reward_format/std": 0.005274359998293221,
"sampling/importance_sampling_ratio/max": 2.3659435749053954,
"sampling/importance_sampling_ratio/mean": 0.98558389544487,
"sampling/importance_sampling_ratio/min": 0.10866836793720722,
"sampling/sampling_logp_difference/max": 0.844302749633789,
"sampling/sampling_logp_difference/mean": 0.005217300402000547,
"step": 2840,
"step_time": 7.812624462896201
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1748.1,
"completions/max_terminated_length": 1522.7,
"completions/mean_length": 204.7,
"completions/mean_terminated_length": 194.7762222290039,
"completions/min_length": 57.3,
"completions/min_terminated_length": 57.3,
"entropy": 0.09565845178440213,
"epoch": 6.102783725910064,
"frac_reward_zero_std": 0.74375,
"grad_norm": 1.1796875,
"learning_rate": 9.715100000000001e-06,
"loss": -0.0083,
"num_tokens": 315939609.0,
"reward": 0.9803320407867432,
"reward_std": 0.3016253627836704,
"rewards/reward_accuracy/mean": 0.880859375,
"rewards/reward_accuracy/std": 0.30036829635500906,
"rewards/reward_format/mean": 0.09947265833616256,
"rewards/reward_format/std": 0.004322804836556315,
"sampling/importance_sampling_ratio/max": 2.5534946441650392,
"sampling/importance_sampling_ratio/mean": 0.9864677965641022,
"sampling/importance_sampling_ratio/min": 0.04280326273292303,
"sampling/sampling_logp_difference/max": 0.9367522120475769,
"sampling/sampling_logp_difference/mean": 0.005777119705453515,
"step": 2850,
"step_time": 8.316417366095994
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1944.2,
"completions/max_terminated_length": 1673.7,
"completions/mean_length": 187.924609375,
"completions/mean_terminated_length": 171.13390045166017,
"completions/min_length": 60.4,
"completions/min_terminated_length": 60.4,
"entropy": 0.07917395369149745,
"epoch": 6.124197002141328,
"frac_reward_zero_std": 0.7875,
"grad_norm": 0.462890625,
"learning_rate": 9.7141e-06,
"loss": -0.0022,
"num_tokens": 316939160.0,
"reward": 1.001015657186508,
"reward_std": 0.2793421074748039,
"rewards/reward_accuracy/mean": 0.901953125,
"rewards/reward_accuracy/std": 0.2762113086879253,
"rewards/reward_format/mean": 0.09906250238418579,
"rewards/reward_format/std": 0.00790701995138079,
"sampling/importance_sampling_ratio/max": 2.375487267971039,
"sampling/importance_sampling_ratio/mean": 0.9812010228633881,
"sampling/importance_sampling_ratio/min": 0.03912873230874538,
"sampling/sampling_logp_difference/max": 0.9409559965133667,
"sampling/sampling_logp_difference/mean": 0.005175716662779451,
"step": 2860,
"step_time": 9.544180748506914
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1604.0,
"completions/max_terminated_length": 1401.4,
"completions/mean_length": 182.90546875,
"completions/mean_terminated_length": 170.67046051025392,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.07293032291345299,
"epoch": 6.145610278372591,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.81640625,
"learning_rate": 9.7131e-06,
"loss": -0.0148,
"num_tokens": 317926134.0,
"reward": 1.0264258086681366,
"reward_std": 0.24464576467871665,
"rewards/reward_accuracy/mean": 0.926953125,
"rewards/reward_accuracy/std": 0.2431375078856945,
"rewards/reward_format/mean": 0.09947265684604645,
"rewards/reward_format/std": 0.00447225826792419,
"sampling/importance_sampling_ratio/max": 2.5396528601646424,
"sampling/importance_sampling_ratio/mean": 0.9869556546211242,
"sampling/importance_sampling_ratio/min": 0.08076556604355574,
"sampling/sampling_logp_difference/max": 0.9132850289344787,
"sampling/sampling_logp_difference/mean": 0.004976247111335397,
"step": 2870,
"step_time": 7.741150473000016
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01328125,
"completions/max_length": 1739.0,
"completions/max_terminated_length": 1472.1,
"completions/mean_length": 209.85625,
"completions/mean_terminated_length": 185.4837173461914,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.08566556633450091,
"epoch": 6.167023554603855,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.54296875,
"learning_rate": 9.712100000000001e-06,
"loss": -0.0099,
"num_tokens": 318979862.0,
"reward": 1.0006054937839508,
"reward_std": 0.28439008742570876,
"rewards/reward_accuracy/mean": 0.901953125,
"rewards/reward_accuracy/std": 0.28094432428479194,
"rewards/reward_format/mean": 0.09865234568715095,
"rewards/reward_format/std": 0.008550265408121049,
"sampling/importance_sampling_ratio/max": 2.4533551692962647,
"sampling/importance_sampling_ratio/mean": 0.9640462517738342,
"sampling/importance_sampling_ratio/min": 0.07870101481676102,
"sampling/sampling_logp_difference/max": 0.7765165030956268,
"sampling/sampling_logp_difference/mean": 0.005422390857711434,
"step": 2880,
"step_time": 8.611016338219633
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1597.2,
"completions/max_terminated_length": 1446.7,
"completions/mean_length": 189.14453125,
"completions/mean_terminated_length": 174.87323303222655,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.08006200878880917,
"epoch": 6.188436830835117,
"frac_reward_zero_std": 0.78125,
"grad_norm": 0.890625,
"learning_rate": 9.711100000000001e-06,
"loss": -0.0048,
"num_tokens": 319981080.0,
"reward": 1.0042187690734863,
"reward_std": 0.25231693089008334,
"rewards/reward_accuracy/mean": 0.905078125,
"rewards/reward_accuracy/std": 0.24947656393051149,
"rewards/reward_format/mean": 0.09914062693715095,
"rewards/reward_format/std": 0.006457022577524185,
"sampling/importance_sampling_ratio/max": 2.6148224592208864,
"sampling/importance_sampling_ratio/mean": 0.9867306351661682,
"sampling/importance_sampling_ratio/min": 0.13530258983373641,
"sampling/sampling_logp_difference/max": 0.8425407409667969,
"sampling/sampling_logp_difference/mean": 0.005149518372491002,
"step": 2890,
"step_time": 7.907115257205442
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1373.1,
"completions/max_terminated_length": 1004.6,
"completions/mean_length": 152.514453125,
"completions/mean_terminated_length": 140.68526611328124,
"completions/min_length": 55.2,
"completions/min_terminated_length": 55.2,
"entropy": 0.06390191437676548,
"epoch": 6.209850107066381,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.5234375,
"learning_rate": 9.7101e-06,
"loss": -0.0127,
"num_tokens": 320880957.0,
"reward": 1.0264648795127869,
"reward_std": 0.23420288786292076,
"rewards/reward_accuracy/mean": 0.926953125,
"rewards/reward_accuracy/std": 0.23207721412181853,
"rewards/reward_format/mean": 0.09951172173023223,
"rewards/reward_format/std": 0.00462527978233993,
"sampling/importance_sampling_ratio/max": 2.2833163380622863,
"sampling/importance_sampling_ratio/mean": 0.9863367676734924,
"sampling/importance_sampling_ratio/min": 0.14230578243732453,
"sampling/sampling_logp_difference/max": 0.8183417081832886,
"sampling/sampling_logp_difference/mean": 0.004521972872316838,
"step": 2900,
"step_time": 6.507547196708037
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1479.8,
"completions/max_terminated_length": 1272.3,
"completions/mean_length": 155.79296875,
"completions/mean_terminated_length": 152.84945373535157,
"completions/min_length": 65.7,
"completions/min_terminated_length": 65.7,
"entropy": 0.05815265798009932,
"epoch": 6.2312633832976445,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.0,
"learning_rate": 9.709100000000002e-06,
"loss": -0.0045,
"num_tokens": 321794699.0,
"reward": 1.0247851729393005,
"reward_std": 0.24337691366672515,
"rewards/reward_accuracy/mean": 0.925,
"rewards/reward_accuracy/std": 0.24256463199853898,
"rewards/reward_format/mean": 0.09978515729308128,
"rewards/reward_format/std": 0.0029578487621620296,
"sampling/importance_sampling_ratio/max": 2.4710018396377564,
"sampling/importance_sampling_ratio/mean": 0.9838850796222687,
"sampling/importance_sampling_ratio/min": 0.15216172039508818,
"sampling/sampling_logp_difference/max": 0.7596921563148499,
"sampling/sampling_logp_difference/mean": 0.004359424510039389,
"step": 2910,
"step_time": 6.802091320615728
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1844.0,
"completions/max_terminated_length": 1532.5,
"completions/mean_length": 180.869140625,
"completions/mean_terminated_length": 169.2870216369629,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.07443553642369807,
"epoch": 6.252676659528908,
"frac_reward_zero_std": 0.74375,
"grad_norm": 0.7890625,
"learning_rate": 9.708100000000001e-06,
"loss": -0.0133,
"num_tokens": 322774588.0,
"reward": 1.0275586128234864,
"reward_std": 0.24266312494874,
"rewards/reward_accuracy/mean": 0.928125,
"rewards/reward_accuracy/std": 0.24101745262742041,
"rewards/reward_format/mean": 0.09943359494209289,
"rewards/reward_format/std": 0.005463109281845391,
"sampling/importance_sampling_ratio/max": 2.4061485886573792,
"sampling/importance_sampling_ratio/mean": 0.9812325358390808,
"sampling/importance_sampling_ratio/min": 0.09277808256447315,
"sampling/sampling_logp_difference/max": 1.0490819275379182,
"sampling/sampling_logp_difference/mean": 0.005190055258572102,
"step": 2920,
"step_time": 8.71310290740512
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1803.4,
"completions/max_terminated_length": 1599.4,
"completions/mean_length": 187.85859375,
"completions/mean_terminated_length": 171.11573333740233,
"completions/min_length": 67.7,
"completions/min_terminated_length": 67.7,
"entropy": 0.0742429334204644,
"epoch": 6.274089935760172,
"frac_reward_zero_std": 0.75625,
"grad_norm": 1.5234375,
"learning_rate": 9.7071e-06,
"loss": -0.0018,
"num_tokens": 323773858.0,
"reward": 1.0065820693969727,
"reward_std": 0.27818734645843507,
"rewards/reward_accuracy/mean": 0.907421875,
"rewards/reward_accuracy/std": 0.27565071284770964,
"rewards/reward_format/mean": 0.09916015863418579,
"rewards/reward_format/std": 0.007220290461555123,
"sampling/importance_sampling_ratio/max": 2.4064992547035216,
"sampling/importance_sampling_ratio/mean": 0.980472457408905,
"sampling/importance_sampling_ratio/min": 0.054949017614126204,
"sampling/sampling_logp_difference/max": 0.9583322882652283,
"sampling/sampling_logp_difference/mean": 0.005061580706387759,
"step": 2930,
"step_time": 8.79097437429009
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1701.4,
"completions/max_terminated_length": 1560.3,
"completions/mean_length": 163.431640625,
"completions/mean_terminated_length": 156.84091491699218,
"completions/min_length": 59.9,
"completions/min_terminated_length": 59.9,
"entropy": 0.0680591200478375,
"epoch": 6.295503211991434,
"frac_reward_zero_std": 0.76875,
"grad_norm": 0.890625,
"learning_rate": 9.7061e-06,
"loss": -0.0101,
"num_tokens": 324708019.0,
"reward": 0.990703147649765,
"reward_std": 0.2950423561036587,
"rewards/reward_accuracy/mean": 0.891015625,
"rewards/reward_accuracy/std": 0.29423649683594705,
"rewards/reward_format/mean": 0.09968750104308129,
"rewards/reward_format/std": 0.0032330699265003203,
"sampling/importance_sampling_ratio/max": 2.635078287124634,
"sampling/importance_sampling_ratio/mean": 0.9879704535007476,
"sampling/importance_sampling_ratio/min": 0.026023026555776596,
"sampling/sampling_logp_difference/max": 1.0884467720985413,
"sampling/sampling_logp_difference/mean": 0.004854377172887325,
"step": 2940,
"step_time": 7.966005238998332
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1555.4,
"completions/max_terminated_length": 1441.6,
"completions/mean_length": 165.410546875,
"completions/mean_terminated_length": 158.0642883300781,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.07013265891000628,
"epoch": 6.316916488222698,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.75,
"learning_rate": 9.705100000000001e-06,
"loss": -0.0062,
"num_tokens": 325652686.0,
"reward": 0.9859570384025573,
"reward_std": 0.28762586787343025,
"rewards/reward_accuracy/mean": 0.886328125,
"rewards/reward_accuracy/std": 0.28666806742548945,
"rewards/reward_format/mean": 0.09962890669703484,
"rewards/reward_format/std": 0.0034726751036942005,
"sampling/importance_sampling_ratio/max": 2.3087040185928345,
"sampling/importance_sampling_ratio/mean": 0.9747376322746277,
"sampling/importance_sampling_ratio/min": 0.09114499660208822,
"sampling/sampling_logp_difference/max": 0.8506425559520722,
"sampling/sampling_logp_difference/mean": 0.004774629254825413,
"step": 2950,
"step_time": 7.421245013811858
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1554.0,
"completions/max_terminated_length": 1414.7,
"completions/mean_length": 148.88984375,
"completions/mean_terminated_length": 144.52186737060546,
"completions/min_length": 60.5,
"completions/min_terminated_length": 60.5,
"entropy": 0.05822511436417699,
"epoch": 6.338329764453961,
"frac_reward_zero_std": 0.83125,
"grad_norm": 0.466796875,
"learning_rate": 9.7041e-06,
"loss": 0.0015,
"num_tokens": 326544660.0,
"reward": 1.0426172077655793,
"reward_std": 0.2144518956542015,
"rewards/reward_accuracy/mean": 0.94296875,
"rewards/reward_accuracy/std": 0.2133030079305172,
"rewards/reward_format/mean": 0.09964843839406967,
"rewards/reward_format/std": 0.003822240373119712,
"sampling/importance_sampling_ratio/max": 2.303489649295807,
"sampling/importance_sampling_ratio/mean": 0.9875134408473969,
"sampling/importance_sampling_ratio/min": 0.14711330011487006,
"sampling/sampling_logp_difference/max": 0.8540403485298157,
"sampling/sampling_logp_difference/mean": 0.004248792352154851,
"step": 2960,
"step_time": 7.485026683611795
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.9793239971477306e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.9793239971477306e-06,
"completions/clipped_ratio": 0.01484375,
"completions/max_length": 1838.0,
"completions/max_terminated_length": 1650.8,
"completions/mean_length": 196.85,
"completions/mean_terminated_length": 169.31371307373047,
"completions/min_length": 65.2,
"completions/min_terminated_length": 65.2,
"entropy": 0.07458760528825223,
"epoch": 6.359743040685225,
"frac_reward_zero_std": 0.7875,
"grad_norm": 0.6875,
"learning_rate": 9.7031e-06,
"loss": -0.0137,
"num_tokens": 327564388.0,
"reward": 1.0200976490974427,
"reward_std": 0.25111438408493997,
"rewards/reward_accuracy/mean": 0.921484375,
"rewards/reward_accuracy/std": 0.24667379781603813,
"rewards/reward_format/mean": 0.09861328154802322,
"rewards/reward_format/std": 0.008897851081565022,
"sampling/importance_sampling_ratio/max": 2.490711498260498,
"sampling/importance_sampling_ratio/mean": 0.9751293063163757,
"sampling/importance_sampling_ratio/min": 0.04483420643955469,
"sampling/sampling_logp_difference/max": 0.9607542872428894,
"sampling/sampling_logp_difference/mean": 0.004911428806371987,
"step": 2970,
"step_time": 8.968189283492393
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.010546875,
"completions/max_length": 1960.7,
"completions/max_terminated_length": 1848.4,
"completions/mean_length": 197.5734375,
"completions/mean_terminated_length": 178.0616683959961,
"completions/min_length": 62.9,
"completions/min_terminated_length": 62.9,
"entropy": 0.08403340424410999,
"epoch": 6.381156316916488,
"frac_reward_zero_std": 0.725,
"grad_norm": 1.84375,
"learning_rate": 9.702100000000002e-06,
"loss": -0.0115,
"num_tokens": 328583584.0,
"reward": 1.0063281416893006,
"reward_std": 0.286511567234993,
"rewards/reward_accuracy/mean": 0.907421875,
"rewards/reward_accuracy/std": 0.2834507778286934,
"rewards/reward_format/mean": 0.09890625029802322,
"rewards/reward_format/std": 0.008147276123054326,
"sampling/importance_sampling_ratio/max": 2.4569594144821165,
"sampling/importance_sampling_ratio/mean": 0.9629213154315949,
"sampling/importance_sampling_ratio/min": 0.03459551110863686,
"sampling/sampling_logp_difference/max": 0.9969267010688782,
"sampling/sampling_logp_difference/mean": 0.005302185844630003,
"step": 2980,
"step_time": 9.39562290631584
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01796875,
"completions/max_length": 1995.5,
"completions/max_terminated_length": 1882.4,
"completions/mean_length": 239.340625,
"completions/mean_terminated_length": 206.79752502441406,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.10217743702232837,
"epoch": 6.402569593147752,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.478515625,
"learning_rate": 9.701100000000001e-06,
"loss": -0.0164,
"num_tokens": 329722888.0,
"reward": 0.994218772649765,
"reward_std": 0.298141747713089,
"rewards/reward_accuracy/mean": 0.895703125,
"rewards/reward_accuracy/std": 0.2941926643252373,
"rewards/reward_format/mean": 0.09851562678813934,
"rewards/reward_format/std": 0.00954983641859144,
"sampling/importance_sampling_ratio/max": 2.5234766483306883,
"sampling/importance_sampling_ratio/mean": 0.9720681130886077,
"sampling/importance_sampling_ratio/min": 0.022490698099136352,
"sampling/sampling_logp_difference/max": 0.8730542182922363,
"sampling/sampling_logp_difference/mean": 0.005790887866169214,
"step": 2990,
"step_time": 9.970470889186254
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1504.2,
"completions/max_terminated_length": 1445.2,
"completions/mean_length": 196.75859375,
"completions/mean_terminated_length": 188.97215576171874,
"completions/min_length": 68.4,
"completions/min_terminated_length": 68.4,
"entropy": 0.09050248186104,
"epoch": 6.423982869379015,
"frac_reward_zero_std": 0.71875,
"grad_norm": 0.578125,
"learning_rate": 9.7001e-06,
"loss": -0.0224,
"num_tokens": 330753470.0,
"reward": 0.9678320527076721,
"reward_std": 0.32038550525903703,
"rewards/reward_accuracy/mean": 0.868359375,
"rewards/reward_accuracy/std": 0.31878711432218554,
"rewards/reward_format/mean": 0.09947265610098839,
"rewards/reward_format/std": 0.00418031383305788,
"sampling/importance_sampling_ratio/max": 2.596120834350586,
"sampling/importance_sampling_ratio/mean": 0.9887279629707336,
"sampling/importance_sampling_ratio/min": 0.060295954905450345,
"sampling/sampling_logp_difference/max": 0.8850611329078675,
"sampling/sampling_logp_difference/mean": 0.005638339137658477,
"step": 3000,
"step_time": 7.265991330219549
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0140625,
"completions/max_length": 1736.2,
"completions/max_terminated_length": 1460.2,
"completions/mean_length": 192.71484375,
"completions/mean_terminated_length": 166.4945281982422,
"completions/min_length": 60.7,
"completions/min_terminated_length": 60.7,
"entropy": 0.07343888743780554,
"epoch": 6.445396145610278,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.21875,
"learning_rate": 9.699100000000002e-06,
"loss": -0.0109,
"num_tokens": 331759156.0,
"reward": 1.0109961032867432,
"reward_std": 0.2530812010169029,
"rewards/reward_accuracy/mean": 0.9125,
"rewards/reward_accuracy/std": 0.24813972562551498,
"rewards/reward_format/mean": 0.09849609434604645,
"rewards/reward_format/std": 0.008494574017822743,
"sampling/importance_sampling_ratio/max": 2.445754110813141,
"sampling/importance_sampling_ratio/mean": 0.9739968419075012,
"sampling/importance_sampling_ratio/min": 0.09460986964404583,
"sampling/sampling_logp_difference/max": 0.9294371247291565,
"sampling/sampling_logp_difference/mean": 0.004835169878788292,
"step": 3010,
"step_time": 8.698457111275639
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.010546875,
"completions/max_length": 1914.1,
"completions/max_terminated_length": 1642.4,
"completions/mean_length": 194.325,
"completions/mean_terminated_length": 174.83358154296874,
"completions/min_length": 61.4,
"completions/min_terminated_length": 61.4,
"entropy": 0.0837082595564425,
"epoch": 6.466809421841542,
"frac_reward_zero_std": 0.7625,
"grad_norm": 0.173828125,
"learning_rate": 9.6981e-06,
"loss": -0.0201,
"num_tokens": 332773396.0,
"reward": 0.9994726777076721,
"reward_std": 0.28643409088253974,
"rewards/reward_accuracy/mean": 0.900390625,
"rewards/reward_accuracy/std": 0.2839830331504345,
"rewards/reward_format/mean": 0.09908203333616257,
"rewards/reward_format/std": 0.007544842944480479,
"sampling/importance_sampling_ratio/max": 2.4898292422294617,
"sampling/importance_sampling_ratio/mean": 0.9775644421577454,
"sampling/importance_sampling_ratio/min": 0.02321482765255496,
"sampling/sampling_logp_difference/max": 0.8514321446418762,
"sampling/sampling_logp_difference/mean": 0.0053217492531985044,
"step": 3020,
"step_time": 9.349783220994869
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1861.7,
"completions/max_terminated_length": 1694.7,
"completions/mean_length": 210.097265625,
"completions/mean_terminated_length": 192.8225830078125,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.0899203833192587,
"epoch": 6.488222698072805,
"frac_reward_zero_std": 0.7375,
"grad_norm": 0.466796875,
"learning_rate": 9.6971e-06,
"loss": -0.0254,
"num_tokens": 333836381.0,
"reward": 1.0033398568630219,
"reward_std": 0.2838347464799881,
"rewards/reward_accuracy/mean": 0.904296875,
"rewards/reward_accuracy/std": 0.2810639962553978,
"rewards/reward_format/mean": 0.09904296919703484,
"rewards/reward_format/std": 0.006924034608528018,
"sampling/importance_sampling_ratio/max": 2.5449090719223024,
"sampling/importance_sampling_ratio/mean": 0.9663503706455231,
"sampling/importance_sampling_ratio/min": 0.02115823272615671,
"sampling/sampling_logp_difference/max": 0.9759299516677856,
"sampling/sampling_logp_difference/mean": 0.005464952532202005,
"step": 3030,
"step_time": 9.20126622171665
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1666.7,
"completions/max_terminated_length": 1589.1,
"completions/mean_length": 196.3015625,
"completions/mean_terminated_length": 179.06285400390624,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.0845637183636427,
"epoch": 6.509635974304069,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.59375,
"learning_rate": 9.6961e-06,
"loss": -0.0052,
"num_tokens": 334853377.0,
"reward": 1.0176758229732514,
"reward_std": 0.2387262724339962,
"rewards/reward_accuracy/mean": 0.91875,
"rewards/reward_accuracy/std": 0.23579344376921654,
"rewards/reward_format/mean": 0.09892578274011612,
"rewards/reward_format/std": 0.00727554049808532,
"sampling/importance_sampling_ratio/max": 2.5389524936676025,
"sampling/importance_sampling_ratio/mean": 0.9629929542541504,
"sampling/importance_sampling_ratio/min": 0.07783268066123128,
"sampling/sampling_logp_difference/max": 1.0376195311546326,
"sampling/sampling_logp_difference/mean": 0.005270836455747485,
"step": 3040,
"step_time": 8.215206360092271
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1903.6,
"completions/max_terminated_length": 1525.9,
"completions/mean_length": 177.35625,
"completions/mean_terminated_length": 164.9183609008789,
"completions/min_length": 64.4,
"completions/min_terminated_length": 64.4,
"entropy": 0.07430883492343128,
"epoch": 6.531049250535332,
"frac_reward_zero_std": 0.8125,
"grad_norm": 0.625,
"learning_rate": 9.695100000000001e-06,
"loss": -0.014,
"num_tokens": 335823057.0,
"reward": 1.028593760728836,
"reward_std": 0.24920837283134462,
"rewards/reward_accuracy/mean": 0.929296875,
"rewards/reward_accuracy/std": 0.24652970507740973,
"rewards/reward_format/mean": 0.09929687604308128,
"rewards/reward_format/std": 0.0056333439890295265,
"sampling/importance_sampling_ratio/max": 2.3939044952392576,
"sampling/importance_sampling_ratio/mean": 0.9909621417522431,
"sampling/importance_sampling_ratio/min": 0.029322638548910616,
"sampling/sampling_logp_difference/max": 1.1125945806503297,
"sampling/sampling_logp_difference/mean": 0.004900855151936412,
"step": 3050,
"step_time": 9.146705343795475
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1744.5,
"completions/max_terminated_length": 1575.6,
"completions/mean_length": 214.625390625,
"completions/mean_terminated_length": 191.92086944580078,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.0965283839032054,
"epoch": 6.552462526766595,
"frac_reward_zero_std": 0.68125,
"grad_norm": 0.6953125,
"learning_rate": 9.694100000000001e-06,
"loss": -0.0125,
"num_tokens": 336896274.0,
"reward": 0.9862695634365082,
"reward_std": 0.28935054689645767,
"rewards/reward_accuracy/mean": 0.8875,
"rewards/reward_accuracy/std": 0.28692646250128745,
"rewards/reward_format/mean": 0.0987695336341858,
"rewards/reward_format/std": 0.007593031064607203,
"sampling/importance_sampling_ratio/max": 2.4673148512840273,
"sampling/importance_sampling_ratio/mean": 0.9739773869514465,
"sampling/importance_sampling_ratio/min": 0.06612161658704281,
"sampling/sampling_logp_difference/max": 1.0947420001029968,
"sampling/sampling_logp_difference/mean": 0.005626443470828235,
"step": 3060,
"step_time": 8.452995163507875
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.011328125,
"completions/max_length": 1555.7,
"completions/max_terminated_length": 1503.4,
"completions/mean_length": 192.270703125,
"completions/mean_terminated_length": 171.61328887939453,
"completions/min_length": 65.6,
"completions/min_terminated_length": 65.6,
"entropy": 0.08418824425898493,
"epoch": 6.573875802997859,
"frac_reward_zero_std": 0.7625,
"grad_norm": 0.55078125,
"learning_rate": 9.6931e-06,
"loss": -0.0071,
"num_tokens": 337907591.0,
"reward": 1.0104492545127868,
"reward_std": 0.265137492865324,
"rewards/reward_accuracy/mean": 0.91171875,
"rewards/reward_accuracy/std": 0.26161878928542137,
"rewards/reward_format/mean": 0.09873047173023224,
"rewards/reward_format/std": 0.007836781302466988,
"sampling/importance_sampling_ratio/max": 2.3062177658081056,
"sampling/importance_sampling_ratio/mean": 0.9724278032779694,
"sampling/importance_sampling_ratio/min": 0.07595136165618896,
"sampling/sampling_logp_difference/max": 0.879375672340393,
"sampling/sampling_logp_difference/mean": 0.005287173320539296,
"step": 3070,
"step_time": 7.843675848506973
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1702.3,
"completions/max_terminated_length": 1411.9,
"completions/mean_length": 187.85390625,
"completions/mean_terminated_length": 171.94145812988282,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.06840049885213376,
"epoch": 6.595289079229122,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.66015625,
"learning_rate": 9.692100000000002e-06,
"loss": -0.006,
"num_tokens": 338911937.0,
"reward": 1.0117383122444152,
"reward_std": 0.27227554842829704,
"rewards/reward_accuracy/mean": 0.9125,
"rewards/reward_accuracy/std": 0.2698555923998356,
"rewards/reward_format/mean": 0.09923828318715096,
"rewards/reward_format/std": 0.00659488330129534,
"sampling/importance_sampling_ratio/max": 2.4358619332313536,
"sampling/importance_sampling_ratio/mean": 0.9799278974533081,
"sampling/importance_sampling_ratio/min": 0.07607167027890682,
"sampling/sampling_logp_difference/max": 0.8617503583431244,
"sampling/sampling_logp_difference/mean": 0.004591421689838171,
"step": 3080,
"step_time": 8.327591932498034
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.8419856132823043e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.8419856132823043e-06,
"completions/clipped_ratio": 0.010546875,
"completions/max_length": 1867.8,
"completions/max_terminated_length": 1779.4,
"completions/mean_length": 195.053515625,
"completions/mean_terminated_length": 175.39825134277345,
"completions/min_length": 62.5,
"completions/min_terminated_length": 62.5,
"entropy": 0.0725121476687491,
"epoch": 6.616702355460386,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.546875,
"learning_rate": 9.691100000000001e-06,
"loss": -0.0088,
"num_tokens": 339923386.0,
"reward": 0.9976953506469727,
"reward_std": 0.29510593265295026,
"rewards/reward_accuracy/mean": 0.898828125,
"rewards/reward_accuracy/std": 0.29205906093120576,
"rewards/reward_format/mean": 0.09886718839406967,
"rewards/reward_format/std": 0.0076739810872823,
"sampling/importance_sampling_ratio/max": 2.3887830495834352,
"sampling/importance_sampling_ratio/mean": 0.9840235769748688,
"sampling/importance_sampling_ratio/min": 0.03201517798006535,
"sampling/sampling_logp_difference/max": 0.8567222535610199,
"sampling/sampling_logp_difference/mean": 0.0048153501003980635,
"step": 3090,
"step_time": 9.082589940889738
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1392.3,
"completions/max_terminated_length": 1249.3,
"completions/mean_length": 170.374609375,
"completions/mean_terminated_length": 158.13645935058594,
"completions/min_length": 59.5,
"completions/min_terminated_length": 59.5,
"entropy": 0.06676638838835061,
"epoch": 6.638115631691649,
"frac_reward_zero_std": 0.78125,
"grad_norm": 0.52734375,
"learning_rate": 9.6901e-06,
"loss": -0.009,
"num_tokens": 340874649.0,
"reward": 1.0266015946865081,
"reward_std": 0.23598900511860849,
"rewards/reward_accuracy/mean": 0.92734375,
"rewards/reward_accuracy/std": 0.23421600833535194,
"rewards/reward_format/mean": 0.0992578148841858,
"rewards/reward_format/std": 0.004198160208761692,
"sampling/importance_sampling_ratio/max": 2.5560555696487426,
"sampling/importance_sampling_ratio/mean": 0.9814868092536926,
"sampling/importance_sampling_ratio/min": 0.05901361405849457,
"sampling/sampling_logp_difference/max": 1.030622124671936,
"sampling/sampling_logp_difference/mean": 0.004814331443049014,
"step": 3100,
"step_time": 6.865743125119479
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.011328125,
"completions/max_length": 1936.1,
"completions/max_terminated_length": 1634.7,
"completions/mean_length": 210.06328125,
"completions/mean_terminated_length": 189.50412139892578,
"completions/min_length": 60.8,
"completions/min_terminated_length": 60.8,
"entropy": 0.08512787935324014,
"epoch": 6.659528907922912,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.21484375,
"learning_rate": 9.689100000000002e-06,
"loss": -0.0141,
"num_tokens": 341931771.0,
"reward": 1.0007226645946503,
"reward_std": 0.27505653649568557,
"rewards/reward_accuracy/mean": 0.901953125,
"rewards/reward_accuracy/std": 0.2715723693370819,
"rewards/reward_format/mean": 0.09876953288912774,
"rewards/reward_format/std": 0.008036889974027872,
"sampling/importance_sampling_ratio/max": 2.576607918739319,
"sampling/importance_sampling_ratio/mean": 0.969846922159195,
"sampling/importance_sampling_ratio/min": 0.04674061853438616,
"sampling/sampling_logp_difference/max": 0.9003856003284454,
"sampling/sampling_logp_difference/mean": 0.005375309567898512,
"step": 3110,
"step_time": 9.39897228050977
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1900.3,
"completions/max_terminated_length": 1628.1,
"completions/mean_length": 186.723046875,
"completions/mean_terminated_length": 177.1954574584961,
"completions/min_length": 65.2,
"completions/min_terminated_length": 65.2,
"entropy": 0.0734944629482925,
"epoch": 6.680942184154175,
"frac_reward_zero_std": 0.78125,
"grad_norm": 0.6796875,
"learning_rate": 9.6881e-06,
"loss": -0.0115,
"num_tokens": 342930470.0,
"reward": 1.0180078327655793,
"reward_std": 0.26384436190128324,
"rewards/reward_accuracy/mean": 0.918359375,
"rewards/reward_accuracy/std": 0.26262165829539297,
"rewards/reward_format/mean": 0.09964843839406967,
"rewards/reward_format/std": 0.0038856583181768657,
"sampling/importance_sampling_ratio/max": 2.440822112560272,
"sampling/importance_sampling_ratio/mean": 0.9913064360618591,
"sampling/importance_sampling_ratio/min": 0.030800138413906098,
"sampling/sampling_logp_difference/max": 1.0040360331535338,
"sampling/sampling_logp_difference/mean": 0.004879950126633048,
"step": 3120,
"step_time": 9.064372623714736
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1538.6,
"completions/max_terminated_length": 1415.7,
"completions/mean_length": 197.34453125,
"completions/mean_terminated_length": 181.11161041259766,
"completions/min_length": 69.9,
"completions/min_terminated_length": 69.9,
"entropy": 0.08034354464616626,
"epoch": 6.702355460385439,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.55078125,
"learning_rate": 9.6871e-06,
"loss": -0.0117,
"num_tokens": 343961592.0,
"reward": 1.007792991399765,
"reward_std": 0.2632139325141907,
"rewards/reward_accuracy/mean": 0.90859375,
"rewards/reward_accuracy/std": 0.26117912381887437,
"rewards/reward_format/mean": 0.09919921979308129,
"rewards/reward_format/std": 0.005555746983736754,
"sampling/importance_sampling_ratio/max": 2.417115807533264,
"sampling/importance_sampling_ratio/mean": 0.9821153461933136,
"sampling/importance_sampling_ratio/min": 0.09809531792998313,
"sampling/sampling_logp_difference/max": 0.9546016812324524,
"sampling/sampling_logp_difference/mean": 0.004945261660031975,
"step": 3130,
"step_time": 7.999522521501058
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1530.1,
"completions/max_terminated_length": 1253.4,
"completions/mean_length": 175.23203125,
"completions/mean_terminated_length": 159.92337188720703,
"completions/min_length": 62.7,
"completions/min_terminated_length": 62.7,
"entropy": 0.06808792836964131,
"epoch": 6.7237687366167025,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.451171875,
"learning_rate": 9.6861e-06,
"loss": -0.0042,
"num_tokens": 344924954.0,
"reward": 1.0273633122444152,
"reward_std": 0.23288238048553467,
"rewards/reward_accuracy/mean": 0.928125,
"rewards/reward_accuracy/std": 0.23074544966220856,
"rewards/reward_format/mean": 0.09923828318715096,
"rewards/reward_format/std": 0.005538069223985076,
"sampling/importance_sampling_ratio/max": 2.503889489173889,
"sampling/importance_sampling_ratio/mean": 0.9847843885421753,
"sampling/importance_sampling_ratio/min": 0.08802944421768188,
"sampling/sampling_logp_difference/max": 0.9752469062805176,
"sampling/sampling_logp_difference/mean": 0.004769455105997622,
"step": 3140,
"step_time": 7.38770708341035
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1724.8,
"completions/max_terminated_length": 1605.1,
"completions/mean_length": 194.559765625,
"completions/mean_terminated_length": 180.99614410400392,
"completions/min_length": 68.6,
"completions/min_terminated_length": 68.6,
"entropy": 0.08309762529097497,
"epoch": 6.745182012847966,
"frac_reward_zero_std": 0.7125,
"grad_norm": 0.734375,
"learning_rate": 9.6851e-06,
"loss": -0.0176,
"num_tokens": 345948931.0,
"reward": 1.0191601753234862,
"reward_std": 0.25425848588347433,
"rewards/reward_accuracy/mean": 0.919921875,
"rewards/reward_accuracy/std": 0.2523136638104916,
"rewards/reward_format/mean": 0.0992382824420929,
"rewards/reward_format/std": 0.005646029766649008,
"sampling/importance_sampling_ratio/max": 2.5714856147766114,
"sampling/importance_sampling_ratio/mean": 0.9900700807571411,
"sampling/importance_sampling_ratio/min": 0.04904551925137639,
"sampling/sampling_logp_difference/max": 0.9542569696903229,
"sampling/sampling_logp_difference/mean": 0.005537397786974907,
"step": 3150,
"step_time": 8.323390145492159
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1729.6,
"completions/max_terminated_length": 1454.4,
"completions/mean_length": 197.57109375,
"completions/mean_terminated_length": 179.5511459350586,
"completions/min_length": 68.9,
"completions/min_terminated_length": 68.9,
"entropy": 0.07925007911399007,
"epoch": 6.766595289079229,
"frac_reward_zero_std": 0.73125,
"grad_norm": 0.56640625,
"learning_rate": 9.684100000000001e-06,
"loss": -0.0154,
"num_tokens": 346977849.0,
"reward": 1.0222851872444152,
"reward_std": 0.2537584722042084,
"rewards/reward_accuracy/mean": 0.923046875,
"rewards/reward_accuracy/std": 0.25141742527484895,
"rewards/reward_format/mean": 0.09923828169703483,
"rewards/reward_format/std": 0.0068889164831489325,
"sampling/importance_sampling_ratio/max": 2.4887802362442017,
"sampling/importance_sampling_ratio/mean": 0.9796376824378967,
"sampling/importance_sampling_ratio/min": 0.04363864436745644,
"sampling/sampling_logp_difference/max": 0.8932682693004608,
"sampling/sampling_logp_difference/mean": 0.005099051119759679,
"step": 3160,
"step_time": 8.422175743328989
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01484375,
"completions/max_length": 1722.6,
"completions/max_terminated_length": 1604.0,
"completions/mean_length": 202.683984375,
"completions/mean_terminated_length": 175.11143341064454,
"completions/min_length": 69.6,
"completions/min_terminated_length": 69.6,
"entropy": 0.08153457879088818,
"epoch": 6.788008565310492,
"frac_reward_zero_std": 0.78125,
"grad_norm": 0.6796875,
"learning_rate": 9.6831e-06,
"loss": -0.001,
"num_tokens": 348017920.0,
"reward": 1.0219336032867432,
"reward_std": 0.25741136223077776,
"rewards/reward_accuracy/mean": 0.923046875,
"rewards/reward_accuracy/std": 0.2536558821797371,
"rewards/reward_format/mean": 0.09888671785593033,
"rewards/reward_format/std": 0.008255041181109845,
"sampling/importance_sampling_ratio/max": 2.5870125532150268,
"sampling/importance_sampling_ratio/mean": 0.978356021642685,
"sampling/importance_sampling_ratio/min": 0.05897313877940178,
"sampling/sampling_logp_difference/max": 1.1501452267169952,
"sampling/sampling_logp_difference/mean": 0.005052779288962484,
"step": 3170,
"step_time": 8.724453201002325
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1705.4,
"completions/max_terminated_length": 1339.7,
"completions/mean_length": 173.9359375,
"completions/mean_terminated_length": 161.5240036010742,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.07094151354394854,
"epoch": 6.809421841541756,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.59765625,
"learning_rate": 9.682100000000002e-06,
"loss": -0.006,
"num_tokens": 348981836.0,
"reward": 1.03974609375,
"reward_std": 0.2224700443446636,
"rewards/reward_accuracy/mean": 0.940234375,
"rewards/reward_accuracy/std": 0.22094230428338052,
"rewards/reward_format/mean": 0.09951171875,
"rewards/reward_format/std": 0.003627279307693243,
"sampling/importance_sampling_ratio/max": 2.4146538972854614,
"sampling/importance_sampling_ratio/mean": 0.9853837490081787,
"sampling/importance_sampling_ratio/min": 0.08318276405334472,
"sampling/sampling_logp_difference/max": 0.7840139687061309,
"sampling/sampling_logp_difference/mean": 0.004928378481417894,
"step": 3180,
"step_time": 8.146054637079942
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1498.1,
"completions/max_terminated_length": 1232.3,
"completions/mean_length": 171.34609375,
"completions/mean_terminated_length": 161.88218841552734,
"completions/min_length": 64.7,
"completions/min_terminated_length": 64.7,
"entropy": 0.07043540207669138,
"epoch": 6.830835117773019,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.328125,
"learning_rate": 9.681100000000001e-06,
"loss": -0.0072,
"num_tokens": 349934994.0,
"reward": 1.0371484637260437,
"reward_std": 0.2201055809855461,
"rewards/reward_accuracy/mean": 0.9375,
"rewards/reward_accuracy/std": 0.21890879943966865,
"rewards/reward_format/mean": 0.09964843913912773,
"rewards/reward_format/std": 0.002729590842500329,
"sampling/importance_sampling_ratio/max": 2.4107971668243406,
"sampling/importance_sampling_ratio/mean": 0.9750582277774811,
"sampling/importance_sampling_ratio/min": 0.15507455207407475,
"sampling/sampling_logp_difference/max": 0.6914917290210724,
"sampling/sampling_logp_difference/mean": 0.0048900325782597065,
"step": 3190,
"step_time": 7.318204835196957
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.014453125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1701.8,
"completions/mean_length": 207.467578125,
"completions/mean_terminated_length": 180.49846801757812,
"completions/min_length": 61.8,
"completions/min_terminated_length": 61.8,
"entropy": 0.09661217690445482,
"epoch": 6.852248394004283,
"frac_reward_zero_std": 0.76875,
"grad_norm": 0.77734375,
"learning_rate": 9.6801e-06,
"loss": -0.0224,
"num_tokens": 350982751.0,
"reward": 1.0229687929153441,
"reward_std": 0.25074737668037417,
"rewards/reward_accuracy/mean": 0.92421875,
"rewards/reward_accuracy/std": 0.2462354026734829,
"rewards/reward_format/mean": 0.09875000342726707,
"rewards/reward_format/std": 0.009043427184224129,
"sampling/importance_sampling_ratio/max": 2.540443241596222,
"sampling/importance_sampling_ratio/mean": 0.9767551839351654,
"sampling/importance_sampling_ratio/min": 0.05512746125459671,
"sampling/sampling_logp_difference/max": 0.9935081779956818,
"sampling/sampling_logp_difference/mean": 0.005468818871304393,
"step": 3200,
"step_time": 9.867727168992861
},
{
"clip_ratio/high_max": 6.004803799442015e-06,
"clip_ratio/high_mean": 7.506004749302519e-07,
"clip_ratio/low_mean": 1.5012009498605038e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.2518013793160206e-06,
"completions/clipped_ratio": 0.02109375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1726.8,
"completions/mean_length": 240.5828125,
"completions/mean_terminated_length": 201.8744674682617,
"completions/min_length": 63.9,
"completions/min_terminated_length": 63.9,
"entropy": 0.11334613142535091,
"epoch": 6.873661670235546,
"frac_reward_zero_std": 0.7125,
"grad_norm": 0.91796875,
"learning_rate": 9.679100000000002e-06,
"loss": -0.0258,
"num_tokens": 352114755.0,
"reward": 0.9923828423023224,
"reward_std": 0.2985704094171524,
"rewards/reward_accuracy/mean": 0.894140625,
"rewards/reward_accuracy/std": 0.293807090818882,
"rewards/reward_format/mean": 0.09824218973517418,
"rewards/reward_format/std": 0.010551774688065053,
"sampling/importance_sampling_ratio/max": 2.4976241111755373,
"sampling/importance_sampling_ratio/mean": 0.9679814875125885,
"sampling/importance_sampling_ratio/min": 0.04250013269484043,
"sampling/sampling_logp_difference/max": 0.9063303232192993,
"sampling/sampling_logp_difference/mean": 0.006165813328698278,
"step": 3210,
"step_time": 10.3526334607217
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1865.5,
"completions/max_terminated_length": 1677.5,
"completions/mean_length": 207.13515625,
"completions/mean_terminated_length": 190.44385986328126,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.08544249585829675,
"epoch": 6.895074946466809,
"frac_reward_zero_std": 0.7625,
"grad_norm": 0.89453125,
"learning_rate": 9.6781e-06,
"loss": -0.0096,
"num_tokens": 353167085.0,
"reward": 1.0187890887260438,
"reward_std": 0.2639410488307476,
"rewards/reward_accuracy/mean": 0.91953125,
"rewards/reward_accuracy/std": 0.2616474486887455,
"rewards/reward_format/mean": 0.09925781413912774,
"rewards/reward_format/std": 0.006774271395988763,
"sampling/importance_sampling_ratio/max": 2.3331639409065246,
"sampling/importance_sampling_ratio/mean": 0.9870075166225434,
"sampling/importance_sampling_ratio/min": 0.013468180596828461,
"sampling/sampling_logp_difference/max": 0.7717556953430176,
"sampling/sampling_logp_difference/mean": 0.0052268861560150984,
"step": 3220,
"step_time": 9.078370269484003
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.016796875,
"completions/max_length": 1905.2,
"completions/max_terminated_length": 1690.8,
"completions/mean_length": 225.058203125,
"completions/mean_terminated_length": 194.27782135009767,
"completions/min_length": 65.2,
"completions/min_terminated_length": 65.2,
"entropy": 0.09935637773014605,
"epoch": 6.916488222698073,
"frac_reward_zero_std": 0.7625,
"grad_norm": 1.65625,
"learning_rate": 9.677100000000001e-06,
"loss": -0.009,
"num_tokens": 354264386.0,
"reward": 1.0000781536102294,
"reward_std": 0.2957387208938599,
"rewards/reward_accuracy/mean": 0.9015625,
"rewards/reward_accuracy/std": 0.2915824130177498,
"rewards/reward_format/mean": 0.09851562604308128,
"rewards/reward_format/std": 0.00977958389557898,
"sampling/importance_sampling_ratio/max": 2.370232117176056,
"sampling/importance_sampling_ratio/mean": 0.9602834641933441,
"sampling/importance_sampling_ratio/min": 0.03656978039070964,
"sampling/sampling_logp_difference/max": 1.0187317669391631,
"sampling/sampling_logp_difference/mean": 0.005729530961252749,
"step": 3230,
"step_time": 9.301596983213676
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1682.4,
"completions/max_terminated_length": 1564.8,
"completions/mean_length": 196.41484375,
"completions/mean_terminated_length": 182.12061309814453,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.07915492272004485,
"epoch": 6.937901498929336,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.68359375,
"learning_rate": 9.6761e-06,
"loss": -0.0039,
"num_tokens": 355278280.0,
"reward": 1.0439062714576721,
"reward_std": 0.1977351985871792,
"rewards/reward_accuracy/mean": 0.94453125,
"rewards/reward_accuracy/std": 0.19541723057627677,
"rewards/reward_format/mean": 0.09937500134110451,
"rewards/reward_format/std": 0.005936383665539324,
"sampling/importance_sampling_ratio/max": 2.3692996740341186,
"sampling/importance_sampling_ratio/mean": 0.9775839447975159,
"sampling/importance_sampling_ratio/min": 0.08451364785432816,
"sampling/sampling_logp_difference/max": 0.8793768048286438,
"sampling/sampling_logp_difference/mean": 0.004919932084158063,
"step": 3240,
"step_time": 8.153547262298526
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.5427237915209844e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.5427237915209844e-06,
"completions/clipped_ratio": 0.013671875,
"completions/max_length": 1915.1,
"completions/max_terminated_length": 1629.7,
"completions/mean_length": 200.5984375,
"completions/mean_terminated_length": 174.94669036865236,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.08342789760790766,
"epoch": 6.9593147751606,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.30078125,
"learning_rate": 9.6751e-06,
"loss": -0.0121,
"num_tokens": 356308788.0,
"reward": 1.0022070467472077,
"reward_std": 0.28227358460426333,
"rewards/reward_accuracy/mean": 0.903515625,
"rewards/reward_accuracy/std": 0.2789628326892853,
"rewards/reward_format/mean": 0.09869140833616256,
"rewards/reward_format/std": 0.00784617851022631,
"sampling/importance_sampling_ratio/max": 2.5853209495544434,
"sampling/importance_sampling_ratio/mean": 0.9784247398376464,
"sampling/importance_sampling_ratio/min": 0.07843666500411928,
"sampling/sampling_logp_difference/max": 0.7621192336082458,
"sampling/sampling_logp_difference/mean": 0.005025321384891868,
"step": 3250,
"step_time": 9.310047466401011
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1818.5,
"completions/max_terminated_length": 1578.9,
"completions/mean_length": 191.06015625,
"completions/mean_terminated_length": 186.0020294189453,
"completions/min_length": 70.4,
"completions/min_terminated_length": 70.4,
"entropy": 0.0825933723244816,
"epoch": 6.980728051391863,
"frac_reward_zero_std": 0.80625,
"grad_norm": 0.54296875,
"learning_rate": 9.674100000000001e-06,
"loss": -0.0081,
"num_tokens": 357312910.0,
"reward": 1.0390429973602295,
"reward_std": 0.2192363016307354,
"rewards/reward_accuracy/mean": 0.939453125,
"rewards/reward_accuracy/std": 0.218021147698164,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.0045264797983691095,
"sampling/importance_sampling_ratio/max": 2.639177751541138,
"sampling/importance_sampling_ratio/mean": 0.9902694702148438,
"sampling/importance_sampling_ratio/min": 0.10253455117344856,
"sampling/sampling_logp_difference/max": 0.7699207305908203,
"sampling/sampling_logp_difference/mean": 0.004949147161096334,
"step": 3260,
"step_time": 8.794259991997388
},
{
"clip_ratio/high_max": 8.840169903123751e-06,
"clip_ratio/high_mean": 1.1050212378904689e-06,
"clip_ratio/low_mean": 2.852655507012969e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.9576767449034375e-06,
"completions/clipped_ratio": 0.0171875,
"completions/max_length": 1915.6,
"completions/max_terminated_length": 1785.3,
"completions/mean_length": 237.708984375,
"completions/mean_terminated_length": 206.16864318847655,
"completions/min_length": 67.4,
"completions/min_terminated_length": 67.4,
"entropy": 0.09841024954803287,
"epoch": 7.002141327623126,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.796875,
"learning_rate": 9.6731e-06,
"loss": -0.0119,
"num_tokens": 358433221.0,
"reward": 1.0258203148841858,
"reward_std": 0.2550796501338482,
"rewards/reward_accuracy/mean": 0.92734375,
"rewards/reward_accuracy/std": 0.24989931657910347,
"rewards/reward_format/mean": 0.09847656190395356,
"rewards/reward_format/std": 0.010017540538683534,
"sampling/importance_sampling_ratio/max": 2.6744590282440184,
"sampling/importance_sampling_ratio/mean": 0.9622101962566376,
"sampling/importance_sampling_ratio/min": 0.006365488562732935,
"sampling/sampling_logp_difference/max": 0.8852793335914612,
"sampling/sampling_logp_difference/mean": 0.005616572545841336,
"step": 3270,
"step_time": 9.525282035511918
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1784.5,
"completions/max_terminated_length": 1623.0,
"completions/mean_length": 225.19375,
"completions/mean_terminated_length": 208.30361938476562,
"completions/min_length": 69.4,
"completions/min_terminated_length": 69.4,
"entropy": 0.09066635593771935,
"epoch": 7.0235546038543895,
"frac_reward_zero_std": 0.78125,
"grad_norm": 0.30859375,
"learning_rate": 9.6721e-06,
"loss": -0.0134,
"num_tokens": 359525685.0,
"reward": 1.0186719000339508,
"reward_std": 0.23618333637714387,
"rewards/reward_accuracy/mean": 0.91953125,
"rewards/reward_accuracy/std": 0.23308473378419875,
"rewards/reward_format/mean": 0.09914062619209289,
"rewards/reward_format/std": 0.007014462072402239,
"sampling/importance_sampling_ratio/max": 2.4903581380844115,
"sampling/importance_sampling_ratio/mean": 0.9792442917823792,
"sampling/importance_sampling_ratio/min": 0.037619469501078126,
"sampling/sampling_logp_difference/max": 0.8622884511947632,
"sampling/sampling_logp_difference/mean": 0.0053989389445632694,
"step": 3280,
"step_time": 8.717433122001239
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02265625,
"completions/max_length": 2045.3,
"completions/max_terminated_length": 1955.9,
"completions/mean_length": 244.11484375,
"completions/mean_terminated_length": 202.3874771118164,
"completions/min_length": 70.4,
"completions/min_terminated_length": 70.4,
"entropy": 0.09157485221512615,
"epoch": 7.044967880085653,
"frac_reward_zero_std": 0.7625,
"grad_norm": 0.263671875,
"learning_rate": 9.671100000000001e-06,
"loss": -0.0184,
"num_tokens": 360670891.0,
"reward": 1.0020312786102294,
"reward_std": 0.2957475632429123,
"rewards/reward_accuracy/mean": 0.90390625,
"rewards/reward_accuracy/std": 0.2898521289229393,
"rewards/reward_format/mean": 0.0981250025331974,
"rewards/reward_format/std": 0.011504734307527542,
"sampling/importance_sampling_ratio/max": 2.47665913105011,
"sampling/importance_sampling_ratio/mean": 0.9685868442058563,
"sampling/importance_sampling_ratio/min": 0.014848452061414719,
"sampling/sampling_logp_difference/max": 0.9666304171085358,
"sampling/sampling_logp_difference/mean": 0.0053056709934026,
"step": 3290,
"step_time": 10.352569579199189
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012109375,
"completions/max_length": 1798.6,
"completions/max_terminated_length": 1695.0,
"completions/mean_length": 214.376953125,
"completions/mean_terminated_length": 192.07720794677735,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.0891616933979094,
"epoch": 7.0663811563169165,
"frac_reward_zero_std": 0.7625,
"grad_norm": 0.640625,
"learning_rate": 9.6701e-06,
"loss": -0.0007,
"num_tokens": 361737504.0,
"reward": 1.0444140553474426,
"reward_std": 0.21247639283537864,
"rewards/reward_accuracy/mean": 0.945703125,
"rewards/reward_accuracy/std": 0.20815800204873086,
"rewards/reward_format/mean": 0.09871093705296516,
"rewards/reward_format/std": 0.00844929509330541,
"sampling/importance_sampling_ratio/max": 2.4769975066185,
"sampling/importance_sampling_ratio/mean": 0.967932653427124,
"sampling/importance_sampling_ratio/min": 0.06790498327463865,
"sampling/sampling_logp_difference/max": 0.769520765542984,
"sampling/sampling_logp_difference/mean": 0.005514096235856414,
"step": 3300,
"step_time": 8.8045773137972
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012109375,
"completions/max_length": 1890.5,
"completions/max_terminated_length": 1685.3,
"completions/mean_length": 218.05625,
"completions/mean_terminated_length": 196.08210144042968,
"completions/min_length": 66.4,
"completions/min_terminated_length": 66.4,
"entropy": 0.10031103943474591,
"epoch": 7.08779443254818,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.43359375,
"learning_rate": 9.669100000000002e-06,
"loss": -0.0028,
"num_tokens": 362811328.0,
"reward": 1.0018945455551147,
"reward_std": 0.28761159628629684,
"rewards/reward_accuracy/mean": 0.902734375,
"rewards/reward_accuracy/std": 0.28538611978292466,
"rewards/reward_format/mean": 0.09916015639901161,
"rewards/reward_format/std": 0.0067238196497783065,
"sampling/importance_sampling_ratio/max": 2.5637635469436644,
"sampling/importance_sampling_ratio/mean": 0.9747008323669434,
"sampling/importance_sampling_ratio/min": 0.05438514649868011,
"sampling/sampling_logp_difference/max": 0.7410892009735107,
"sampling/sampling_logp_difference/mean": 0.00574085796251893,
"step": 3310,
"step_time": 9.288107247807783
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1520.7,
"completions/max_terminated_length": 1453.2,
"completions/mean_length": 184.21171875,
"completions/mean_terminated_length": 166.11487274169923,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.07675529276020825,
"epoch": 7.109207708779444,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.80859375,
"learning_rate": 9.6681e-06,
"loss": -0.0074,
"num_tokens": 363791502.0,
"reward": 1.0353515863418579,
"reward_std": 0.22756873741745948,
"rewards/reward_accuracy/mean": 0.936328125,
"rewards/reward_accuracy/std": 0.22490202784538268,
"rewards/reward_format/mean": 0.09902343824505806,
"rewards/reward_format/std": 0.006103196856565773,
"sampling/importance_sampling_ratio/max": 2.308181548118591,
"sampling/importance_sampling_ratio/mean": 0.9864411234855652,
"sampling/importance_sampling_ratio/min": 0.0686867143958807,
"sampling/sampling_logp_difference/max": 0.7878016710281373,
"sampling/sampling_logp_difference/mean": 0.004796441690996289,
"step": 3320,
"step_time": 7.567877351291827
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1593.2,
"completions/max_terminated_length": 1499.8,
"completions/mean_length": 184.4203125,
"completions/mean_terminated_length": 168.50992279052736,
"completions/min_length": 60.9,
"completions/min_terminated_length": 60.9,
"entropy": 0.070585562242195,
"epoch": 7.130620985010706,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.443359375,
"learning_rate": 9.667100000000001e-06,
"loss": -0.0076,
"num_tokens": 364779538.0,
"reward": 1.024179708957672,
"reward_std": 0.25484727025032045,
"rewards/reward_accuracy/mean": 0.925,
"rewards/reward_accuracy/std": 0.2521743305027485,
"rewards/reward_format/mean": 0.09917968884110451,
"rewards/reward_format/std": 0.005711801699362695,
"sampling/importance_sampling_ratio/max": 2.623803496360779,
"sampling/importance_sampling_ratio/mean": 0.9855225205421447,
"sampling/importance_sampling_ratio/min": 0.05693019926548004,
"sampling/sampling_logp_difference/max": 0.9949729800224304,
"sampling/sampling_logp_difference/mean": 0.004714632825925946,
"step": 3330,
"step_time": 7.961959710792871
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1339.1,
"completions/max_terminated_length": 1203.6,
"completions/mean_length": 167.9953125,
"completions/mean_terminated_length": 151.85559844970703,
"completions/min_length": 63.7,
"completions/min_terminated_length": 63.7,
"entropy": 0.05746339033357799,
"epoch": 7.15203426124197,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.56640625,
"learning_rate": 9.6661e-06,
"loss": 0.0024,
"num_tokens": 365717510.0,
"reward": 1.042988306283951,
"reward_std": 0.20563983246684076,
"rewards/reward_accuracy/mean": 0.94375,
"rewards/reward_accuracy/std": 0.2028396688401699,
"rewards/reward_format/mean": 0.09923828318715096,
"rewards/reward_format/std": 0.005302754323929548,
"sampling/importance_sampling_ratio/max": 2.1378695607185363,
"sampling/importance_sampling_ratio/mean": 0.9965870797634124,
"sampling/importance_sampling_ratio/min": 0.10889309383928776,
"sampling/sampling_logp_difference/max": 0.8405689120292663,
"sampling/sampling_logp_difference/mean": 0.003983828029595316,
"step": 3340,
"step_time": 6.785003222100204
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1563.1,
"completions/max_terminated_length": 1529.3,
"completions/mean_length": 196.49140625,
"completions/mean_terminated_length": 181.47274017333984,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"entropy": 0.08219872526824475,
"epoch": 7.173447537473233,
"frac_reward_zero_std": 0.78125,
"grad_norm": 0.81640625,
"learning_rate": 9.6651e-06,
"loss": -0.0162,
"num_tokens": 366738992.0,
"reward": 1.0173632979393006,
"reward_std": 0.22869633436203002,
"rewards/reward_accuracy/mean": 0.918359375,
"rewards/reward_accuracy/std": 0.22653116434812545,
"rewards/reward_format/mean": 0.09900390803813934,
"rewards/reward_format/std": 0.005462064943276346,
"sampling/importance_sampling_ratio/max": 2.559286284446716,
"sampling/importance_sampling_ratio/mean": 0.9900839745998382,
"sampling/importance_sampling_ratio/min": 0.12801584005355834,
"sampling/sampling_logp_difference/max": 0.7365347623825074,
"sampling/sampling_logp_difference/mean": 0.005099473614245653,
"step": 3350,
"step_time": 7.608476221002638
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1975.7,
"completions/max_terminated_length": 1520.8,
"completions/mean_length": 200.56328125,
"completions/mean_terminated_length": 187.50598602294923,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.08083262722939252,
"epoch": 7.194860813704497,
"frac_reward_zero_std": 0.78125,
"grad_norm": 0.2197265625,
"learning_rate": 9.664100000000001e-06,
"loss": -0.0049,
"num_tokens": 367775826.0,
"reward": 1.023300790786743,
"reward_std": 0.2523004345595837,
"rewards/reward_accuracy/mean": 0.923828125,
"rewards/reward_accuracy/std": 0.2509389385581017,
"rewards/reward_format/mean": 0.0994726575911045,
"rewards/reward_format/std": 0.004993388382717967,
"sampling/importance_sampling_ratio/max": 2.633357524871826,
"sampling/importance_sampling_ratio/mean": 0.9816145718097686,
"sampling/importance_sampling_ratio/min": 0.05312061682343483,
"sampling/sampling_logp_difference/max": 0.7568632364273071,
"sampling/sampling_logp_difference/mean": 0.005090389586985111,
"step": 3360,
"step_time": 9.576161346997832
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1698.5,
"completions/max_terminated_length": 1471.4,
"completions/mean_length": 179.533203125,
"completions/mean_terminated_length": 171.66168975830078,
"completions/min_length": 61.5,
"completions/min_terminated_length": 61.5,
"entropy": 0.07176343444734812,
"epoch": 7.2162740899357605,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.388671875,
"learning_rate": 9.6631e-06,
"loss": 0.0001,
"num_tokens": 368749831.0,
"reward": 1.0382031440734862,
"reward_std": 0.22528216764330863,
"rewards/reward_accuracy/mean": 0.938671875,
"rewards/reward_accuracy/std": 0.22385090216994286,
"rewards/reward_format/mean": 0.0995312511920929,
"rewards/reward_format/std": 0.004448432335630059,
"sampling/importance_sampling_ratio/max": 2.3991798400878905,
"sampling/importance_sampling_ratio/mean": 0.9798927545547486,
"sampling/importance_sampling_ratio/min": 0.0806032434105873,
"sampling/sampling_logp_difference/max": 1.0265131533145904,
"sampling/sampling_logp_difference/mean": 0.004841399472206831,
"step": 3370,
"step_time": 8.137774265097686
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1790.5,
"completions/max_terminated_length": 1671.4,
"completions/mean_length": 208.026171875,
"completions/mean_terminated_length": 194.4228256225586,
"completions/min_length": 67.7,
"completions/min_terminated_length": 67.7,
"entropy": 0.09435573569498956,
"epoch": 7.237687366167023,
"frac_reward_zero_std": 0.78125,
"grad_norm": 0.306640625,
"learning_rate": 9.6621e-06,
"loss": -0.0217,
"num_tokens": 369803754.0,
"reward": 1.0087305068969727,
"reward_std": 0.26291498988866807,
"rewards/reward_accuracy/mean": 0.909765625,
"rewards/reward_accuracy/std": 0.2602637678384781,
"rewards/reward_format/mean": 0.0989648461341858,
"rewards/reward_format/std": 0.007395649282261729,
"sampling/importance_sampling_ratio/max": 2.4140501499176024,
"sampling/importance_sampling_ratio/mean": 0.9743441939353943,
"sampling/importance_sampling_ratio/min": 0.07576013468205929,
"sampling/sampling_logp_difference/max": 0.7226411461830139,
"sampling/sampling_logp_difference/mean": 0.005598669592291117,
"step": 3380,
"step_time": 8.66884524608613
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.016015625,
"completions/max_length": 1810.7,
"completions/max_terminated_length": 1625.6,
"completions/mean_length": 210.70546875,
"completions/mean_terminated_length": 181.3903564453125,
"completions/min_length": 72.4,
"completions/min_terminated_length": 72.4,
"entropy": 0.08215742972679436,
"epoch": 7.259100642398287,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.30078125,
"learning_rate": 9.661100000000001e-06,
"loss": -0.0151,
"num_tokens": 370864088.0,
"reward": 0.9992773771286011,
"reward_std": 0.2896846026182175,
"rewards/reward_accuracy/mean": 0.90078125,
"rewards/reward_accuracy/std": 0.2860997974872589,
"rewards/reward_format/mean": 0.09849609583616256,
"rewards/reward_format/std": 0.0080746338237077,
"sampling/importance_sampling_ratio/max": 2.369885230064392,
"sampling/importance_sampling_ratio/mean": 0.977127057313919,
"sampling/importance_sampling_ratio/min": 0.05510226914775558,
"sampling/sampling_logp_difference/max": 0.9619598269462586,
"sampling/sampling_logp_difference/mean": 0.005045811925083399,
"step": 3390,
"step_time": 8.949462137118099
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.010546875,
"completions/max_length": 1725.6,
"completions/max_terminated_length": 1469.0,
"completions/mean_length": 194.966796875,
"completions/mean_terminated_length": 175.6450637817383,
"completions/min_length": 65.6,
"completions/min_terminated_length": 65.6,
"entropy": 0.07500704084523022,
"epoch": 7.28051391862955,
"frac_reward_zero_std": 0.7875,
"grad_norm": 0.51171875,
"learning_rate": 9.660100000000001e-06,
"loss": -0.0111,
"num_tokens": 371880883.0,
"reward": 1.021054708957672,
"reward_std": 0.24685753136873245,
"rewards/reward_accuracy/mean": 0.922265625,
"rewards/reward_accuracy/std": 0.24388763830065727,
"rewards/reward_format/mean": 0.0987890638411045,
"rewards/reward_format/std": 0.007108032330870628,
"sampling/importance_sampling_ratio/max": 2.3540061354637145,
"sampling/importance_sampling_ratio/mean": 0.9824026048183441,
"sampling/importance_sampling_ratio/min": 0.11520192297175527,
"sampling/sampling_logp_difference/max": 0.8268107295036315,
"sampling/sampling_logp_difference/mean": 0.004963035695254803,
"step": 3400,
"step_time": 8.47432227540412
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1732.0,
"completions/max_terminated_length": 1570.1,
"completions/mean_length": 194.91953125,
"completions/mean_terminated_length": 179.0708984375,
"completions/min_length": 68.6,
"completions/min_terminated_length": 68.6,
"entropy": 0.083404062082991,
"epoch": 7.301927194860814,
"frac_reward_zero_std": 0.78125,
"grad_norm": 0.287109375,
"learning_rate": 9.659100000000002e-06,
"loss": -0.0211,
"num_tokens": 372907413.0,
"reward": 1.0133008003234862,
"reward_std": 0.26836530640721323,
"rewards/reward_accuracy/mean": 0.9140625,
"rewards/reward_accuracy/std": 0.265990399569273,
"rewards/reward_format/mean": 0.09923828318715096,
"rewards/reward_format/std": 0.006447123875841498,
"sampling/importance_sampling_ratio/max": 2.3255369305610656,
"sampling/importance_sampling_ratio/mean": 0.9762274026870728,
"sampling/importance_sampling_ratio/min": 0.020890150964260102,
"sampling/sampling_logp_difference/max": 0.8718695223331452,
"sampling/sampling_logp_difference/mean": 0.00542395084630698,
"step": 3410,
"step_time": 8.434645749386982
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1657.4,
"completions/max_terminated_length": 1526.7,
"completions/mean_length": 172.232421875,
"completions/mean_terminated_length": 165.01913604736328,
"completions/min_length": 61.2,
"completions/min_terminated_length": 61.2,
"entropy": 0.0677159072831273,
"epoch": 7.323340471092077,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.59375,
"learning_rate": 9.6581e-06,
"loss": -0.0075,
"num_tokens": 373867624.0,
"reward": 1.045097666978836,
"reward_std": 0.20988606065511703,
"rewards/reward_accuracy/mean": 0.945703125,
"rewards/reward_accuracy/std": 0.2077530086040497,
"rewards/reward_format/mean": 0.09939453229308129,
"rewards/reward_format/std": 0.004928422602824866,
"sampling/importance_sampling_ratio/max": 2.455026662349701,
"sampling/importance_sampling_ratio/mean": 0.9876531362533569,
"sampling/importance_sampling_ratio/min": 0.11230104714632035,
"sampling/sampling_logp_difference/max": 0.9560344338417053,
"sampling/sampling_logp_difference/mean": 0.004741659434512257,
"step": 3420,
"step_time": 8.0314018484205
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1572.8,
"completions/max_terminated_length": 1342.0,
"completions/mean_length": 165.07890625,
"completions/mean_terminated_length": 157.73566513061525,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.06542185610160231,
"epoch": 7.344753747323341,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.423828125,
"learning_rate": 9.657100000000001e-06,
"loss": -0.0057,
"num_tokens": 374810690.0,
"reward": 1.035058605670929,
"reward_std": 0.21384989991784095,
"rewards/reward_accuracy/mean": 0.935546875,
"rewards/reward_accuracy/std": 0.21213285103440285,
"rewards/reward_format/mean": 0.09951172024011612,
"rewards/reward_format/std": 0.004377176123671234,
"sampling/importance_sampling_ratio/max": 2.352167546749115,
"sampling/importance_sampling_ratio/mean": 0.9832280516624451,
"sampling/importance_sampling_ratio/min": 0.12875920571386815,
"sampling/sampling_logp_difference/max": 0.9258468866348266,
"sampling/sampling_logp_difference/mean": 0.004711185768246651,
"step": 3430,
"step_time": 7.4631633680837695
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1455.5,
"completions/max_terminated_length": 1281.5,
"completions/mean_length": 185.56484375,
"completions/mean_terminated_length": 169.64768981933594,
"completions/min_length": 62.1,
"completions/min_terminated_length": 62.1,
"entropy": 0.07408427484333516,
"epoch": 7.3661670235546035,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.82421875,
"learning_rate": 9.6561e-06,
"loss": -0.0068,
"num_tokens": 375805672.0,
"reward": 1.026953148841858,
"reward_std": 0.2343786023557186,
"rewards/reward_accuracy/mean": 0.927734375,
"rewards/reward_accuracy/std": 0.2321012146770954,
"rewards/reward_format/mean": 0.09921875,
"rewards/reward_format/std": 0.005500388029031455,
"sampling/importance_sampling_ratio/max": 2.4101555347442627,
"sampling/importance_sampling_ratio/mean": 0.9884947180747986,
"sampling/importance_sampling_ratio/min": 0.10133547000586987,
"sampling/sampling_logp_difference/max": 0.7599872410297394,
"sampling/sampling_logp_difference/mean": 0.004756988282315433,
"step": 3440,
"step_time": 7.333108228095807
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1453.5,
"completions/max_terminated_length": 1283.3,
"completions/mean_length": 174.845703125,
"completions/mean_terminated_length": 163.28630981445312,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.07016745409928263,
"epoch": 7.387580299785867,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.67578125,
"learning_rate": 9.6551e-06,
"loss": -0.0082,
"num_tokens": 376773149.0,
"reward": 1.0353320717811585,
"reward_std": 0.225161661952734,
"rewards/reward_accuracy/mean": 0.9359375,
"rewards/reward_accuracy/std": 0.22313873693346978,
"rewards/reward_format/mean": 0.09939453303813935,
"rewards/reward_format/std": 0.004817742272280157,
"sampling/importance_sampling_ratio/max": 2.3925696492195128,
"sampling/importance_sampling_ratio/mean": 0.980224746465683,
"sampling/importance_sampling_ratio/min": 0.16615120097994804,
"sampling/sampling_logp_difference/max": 0.8308257579803466,
"sampling/sampling_logp_difference/mean": 0.004736596904695034,
"step": 3450,
"step_time": 7.228971158605418
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1636.5,
"completions/max_terminated_length": 1428.7,
"completions/mean_length": 174.59609375,
"completions/mean_terminated_length": 168.77745971679687,
"completions/min_length": 62.2,
"completions/min_terminated_length": 62.2,
"entropy": 0.07098064827732742,
"epoch": 7.408993576017131,
"frac_reward_zero_std": 0.83125,
"grad_norm": 0.0,
"learning_rate": 9.654100000000001e-06,
"loss": -0.0064,
"num_tokens": 377736899.0,
"reward": 1.0195117473602295,
"reward_std": 0.24793211817741395,
"rewards/reward_accuracy/mean": 0.919921875,
"rewards/reward_accuracy/std": 0.2469735935330391,
"rewards/reward_format/mean": 0.09958984553813935,
"rewards/reward_format/std": 0.0035606355872005225,
"sampling/importance_sampling_ratio/max": 2.3893094301223754,
"sampling/importance_sampling_ratio/mean": 0.9814814686775207,
"sampling/importance_sampling_ratio/min": 0.07128524258732796,
"sampling/sampling_logp_difference/max": 1.0437074542045592,
"sampling/sampling_logp_difference/mean": 0.0047689436469227076,
"step": 3460,
"step_time": 7.757307374506491
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1742.4,
"completions/max_terminated_length": 1467.2,
"completions/mean_length": 188.274609375,
"completions/mean_terminated_length": 171.57939453125,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.06974120223894716,
"epoch": 7.430406852248394,
"frac_reward_zero_std": 0.7875,
"grad_norm": 0.578125,
"learning_rate": 9.6531e-06,
"loss": -0.0052,
"num_tokens": 378738866.0,
"reward": 1.0167187690734862,
"reward_std": 0.2724547773599625,
"rewards/reward_accuracy/mean": 0.917578125,
"rewards/reward_accuracy/std": 0.26961921751499174,
"rewards/reward_format/mean": 0.09914062619209289,
"rewards/reward_format/std": 0.00695686605758965,
"sampling/importance_sampling_ratio/max": 2.331894505023956,
"sampling/importance_sampling_ratio/mean": 0.9816995561122894,
"sampling/importance_sampling_ratio/min": 0.08396409675478936,
"sampling/sampling_logp_difference/max": 0.7950213193893433,
"sampling/sampling_logp_difference/mean": 0.0046781815588474275,
"step": 3470,
"step_time": 8.383170842906111
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1769.7,
"completions/max_terminated_length": 1589.9,
"completions/mean_length": 169.1078125,
"completions/mean_terminated_length": 163.99112243652343,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"entropy": 0.07172263083048165,
"epoch": 7.451820128479658,
"frac_reward_zero_std": 0.83125,
"grad_norm": 0.494140625,
"learning_rate": 9.6521e-06,
"loss": -0.0162,
"num_tokens": 379681462.0,
"reward": 1.0418750166893005,
"reward_std": 0.21953056752681732,
"rewards/reward_accuracy/mean": 0.9421875,
"rewards/reward_accuracy/std": 0.21816140785813332,
"rewards/reward_format/mean": 0.09968750178813934,
"rewards/reward_format/std": 0.003516834997572005,
"sampling/importance_sampling_ratio/max": 2.2060760498046874,
"sampling/importance_sampling_ratio/mean": 0.9813469767570495,
"sampling/importance_sampling_ratio/min": 0.06298888567835093,
"sampling/sampling_logp_difference/max": 0.7237028121948242,
"sampling/sampling_logp_difference/mean": 0.004777360800653696,
"step": 3480,
"step_time": 8.211497805183171
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1524.2,
"completions/max_terminated_length": 1352.4,
"completions/mean_length": 193.331640625,
"completions/mean_terminated_length": 175.93778228759766,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.07294777273200452,
"epoch": 7.473233404710921,
"frac_reward_zero_std": 0.84375,
"grad_norm": 0.0,
"learning_rate": 9.651100000000001e-06,
"loss": -0.0112,
"num_tokens": 380692919.0,
"reward": 1.0205078303813935,
"reward_std": 0.23931595981121062,
"rewards/reward_accuracy/mean": 0.921484375,
"rewards/reward_accuracy/std": 0.23645213544368743,
"rewards/reward_format/mean": 0.09902343824505806,
"rewards/reward_format/std": 0.006364708347246051,
"sampling/importance_sampling_ratio/max": 2.463054084777832,
"sampling/importance_sampling_ratio/mean": 0.9897466897964478,
"sampling/importance_sampling_ratio/min": 0.15956836370751262,
"sampling/sampling_logp_difference/max": 0.8044601678848267,
"sampling/sampling_logp_difference/mean": 0.004700424941256642,
"step": 3490,
"step_time": 7.733619213412749
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1491.9,
"completions/max_terminated_length": 1301.6,
"completions/mean_length": 183.9828125,
"completions/mean_terminated_length": 169.66688385009766,
"completions/min_length": 63.9,
"completions/min_terminated_length": 63.9,
"entropy": 0.07193335867486894,
"epoch": 7.494646680942184,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.447265625,
"learning_rate": 9.650100000000001e-06,
"loss": -0.0038,
"num_tokens": 381680683.0,
"reward": 1.0352734625339508,
"reward_std": 0.22542870789766312,
"rewards/reward_accuracy/mean": 0.9359375,
"rewards/reward_accuracy/std": 0.22362848296761512,
"rewards/reward_format/mean": 0.09933593794703484,
"rewards/reward_format/std": 0.004681437858380377,
"sampling/importance_sampling_ratio/max": 2.579133939743042,
"sampling/importance_sampling_ratio/mean": 0.9951997339725495,
"sampling/importance_sampling_ratio/min": 0.10664892476052046,
"sampling/sampling_logp_difference/max": 0.9161568403244018,
"sampling/sampling_logp_difference/mean": 0.004791031149215997,
"step": 3500,
"step_time": 7.226418416496017
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.014453125,
"completions/max_length": 1754.7,
"completions/max_terminated_length": 1501.9,
"completions/mean_length": 213.523046875,
"completions/mean_terminated_length": 186.93712615966797,
"completions/min_length": 66.4,
"completions/min_terminated_length": 66.4,
"entropy": 0.08276629685424268,
"epoch": 7.516059957173447,
"frac_reward_zero_std": 0.7875,
"grad_norm": 0.58984375,
"learning_rate": 9.6491e-06,
"loss": -0.0192,
"num_tokens": 382747030.0,
"reward": 1.0307031393051147,
"reward_std": 0.20840179056394845,
"rewards/reward_accuracy/mean": 0.93203125,
"rewards/reward_accuracy/std": 0.20445542484521867,
"rewards/reward_format/mean": 0.09867187663912773,
"rewards/reward_format/std": 0.008004973968490958,
"sampling/importance_sampling_ratio/max": 2.488348937034607,
"sampling/importance_sampling_ratio/mean": 0.9904955327510834,
"sampling/importance_sampling_ratio/min": 0.07925322242081165,
"sampling/sampling_logp_difference/max": 0.9046316027641297,
"sampling/sampling_logp_difference/mean": 0.005093022738583386,
"step": 3510,
"step_time": 9.069562981493073
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1817.2,
"completions/max_terminated_length": 1682.8,
"completions/mean_length": 196.301171875,
"completions/mean_terminated_length": 183.21285858154297,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.0781431627459824,
"epoch": 7.537473233404711,
"frac_reward_zero_std": 0.8125,
"grad_norm": 0.2138671875,
"learning_rate": 9.6481e-06,
"loss": -0.0086,
"num_tokens": 383768473.0,
"reward": 1.0382617354393004,
"reward_std": 0.23688462674617766,
"rewards/reward_accuracy/mean": 0.9390625,
"rewards/reward_accuracy/std": 0.23389212191104888,
"rewards/reward_format/mean": 0.0991992212831974,
"rewards/reward_format/std": 0.0061727965017780665,
"sampling/importance_sampling_ratio/max": 2.515777027606964,
"sampling/importance_sampling_ratio/mean": 0.9892849266529083,
"sampling/importance_sampling_ratio/min": 0.06451786058023572,
"sampling/sampling_logp_difference/max": 0.8503926396369934,
"sampling/sampling_logp_difference/mean": 0.005204221839085222,
"step": 3520,
"step_time": 8.839511836090242
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1853.2,
"completions/max_terminated_length": 1539.9,
"completions/mean_length": 206.81640625,
"completions/mean_terminated_length": 191.7426971435547,
"completions/min_length": 71.4,
"completions/min_terminated_length": 71.4,
"entropy": 0.07850905498489738,
"epoch": 7.5588865096359745,
"frac_reward_zero_std": 0.74375,
"grad_norm": 0.1572265625,
"learning_rate": 9.647100000000001e-06,
"loss": -0.0192,
"num_tokens": 384824675.0,
"reward": 1.0029101729393006,
"reward_std": 0.2915870785713196,
"rewards/reward_accuracy/mean": 0.903515625,
"rewards/reward_accuracy/std": 0.28989855796098707,
"rewards/reward_format/mean": 0.09939453303813935,
"rewards/reward_format/std": 0.004416590882465243,
"sampling/importance_sampling_ratio/max": 2.3227914571762085,
"sampling/importance_sampling_ratio/mean": 0.9731649398803711,
"sampling/importance_sampling_ratio/min": 0.05918755829334259,
"sampling/sampling_logp_difference/max": 1.1002968966960907,
"sampling/sampling_logp_difference/mean": 0.0051331820897758005,
"step": 3530,
"step_time": 8.962081403494812
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1795.3,
"completions/max_terminated_length": 1648.1,
"completions/mean_length": 206.9046875,
"completions/mean_terminated_length": 194.70974884033203,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.0791555711068213,
"epoch": 7.580299785867238,
"frac_reward_zero_std": 0.7625,
"grad_norm": 0.609375,
"learning_rate": 9.6461e-06,
"loss": -0.0098,
"num_tokens": 385875151.0,
"reward": 1.032187533378601,
"reward_std": 0.2269599534571171,
"rewards/reward_accuracy/mean": 0.9328125,
"rewards/reward_accuracy/std": 0.22451604753732682,
"rewards/reward_format/mean": 0.09937500208616257,
"rewards/reward_format/std": 0.0063434979412704704,
"sampling/importance_sampling_ratio/max": 2.4235900402069093,
"sampling/importance_sampling_ratio/mean": 0.9742930710315705,
"sampling/importance_sampling_ratio/min": 0.044096536189317706,
"sampling/sampling_logp_difference/max": 0.9425219833850861,
"sampling/sampling_logp_difference/mean": 0.005189129477366805,
"step": 3540,
"step_time": 8.735905734007247
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1817.4,
"completions/max_terminated_length": 1457.0,
"completions/mean_length": 189.296875,
"completions/mean_terminated_length": 176.27302093505858,
"completions/min_length": 68.6,
"completions/min_terminated_length": 68.6,
"entropy": 0.08457684773020446,
"epoch": 7.601713062098501,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.65625,
"learning_rate": 9.6451e-06,
"loss": -0.0084,
"num_tokens": 386865943.0,
"reward": 1.0298437654972077,
"reward_std": 0.23030798956751825,
"rewards/reward_accuracy/mean": 0.93046875,
"rewards/reward_accuracy/std": 0.22799715101718904,
"rewards/reward_format/mean": 0.09937500134110451,
"rewards/reward_format/std": 0.0058000365039333705,
"sampling/importance_sampling_ratio/max": 2.4601676225662232,
"sampling/importance_sampling_ratio/mean": 0.985438346862793,
"sampling/importance_sampling_ratio/min": 0.05417675971984863,
"sampling/sampling_logp_difference/max": 1.2866152942180633,
"sampling/sampling_logp_difference/mean": 0.005278515862300992,
"step": 3550,
"step_time": 8.724588283686899
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1924.0,
"completions/max_terminated_length": 1833.3,
"completions/mean_length": 221.47578125,
"completions/mean_terminated_length": 201.39368591308593,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.09304863582365215,
"epoch": 7.623126338329764,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.482421875,
"learning_rate": 9.644100000000001e-06,
"loss": -0.0149,
"num_tokens": 387948073.0,
"reward": 1.0230078160762788,
"reward_std": 0.24172194972634314,
"rewards/reward_accuracy/mean": 0.923828125,
"rewards/reward_accuracy/std": 0.23951757848262786,
"rewards/reward_format/mean": 0.09917968809604645,
"rewards/reward_format/std": 0.006854501576162875,
"sampling/importance_sampling_ratio/max": 2.5714925646781923,
"sampling/importance_sampling_ratio/mean": 0.9695788264274597,
"sampling/importance_sampling_ratio/min": 0.007600085623562336,
"sampling/sampling_logp_difference/max": 1.1584279179573058,
"sampling/sampling_logp_difference/mean": 0.0053932322189211845,
"step": 3560,
"step_time": 9.565942136521334
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02109375,
"completions/max_length": 1888.2,
"completions/max_terminated_length": 1693.4,
"completions/mean_length": 229.6140625,
"completions/mean_terminated_length": 192.34349517822267,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.08904545116238297,
"epoch": 7.644539614561028,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.263671875,
"learning_rate": 9.643100000000001e-06,
"loss": -0.0102,
"num_tokens": 389059565.0,
"reward": 1.0058203518390656,
"reward_std": 0.2585896894335747,
"rewards/reward_accuracy/mean": 0.907421875,
"rewards/reward_accuracy/std": 0.25480627194046973,
"rewards/reward_format/mean": 0.09839844033122062,
"rewards/reward_format/std": 0.008473186567425729,
"sampling/importance_sampling_ratio/max": 2.564835250377655,
"sampling/importance_sampling_ratio/mean": 0.9578584909439087,
"sampling/importance_sampling_ratio/min": 0.0394745871424675,
"sampling/sampling_logp_difference/max": 1.1935293197631835,
"sampling/sampling_logp_difference/mean": 0.005618822993710637,
"step": 3570,
"step_time": 9.460387960809749
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1819.9,
"completions/max_terminated_length": 1489.8,
"completions/mean_length": 186.5265625,
"completions/mean_terminated_length": 172.73394775390625,
"completions/min_length": 67.2,
"completions/min_terminated_length": 67.2,
"entropy": 0.06988995401188731,
"epoch": 7.665952890792291,
"frac_reward_zero_std": 0.74375,
"grad_norm": 0.306640625,
"learning_rate": 9.6421e-06,
"loss": -0.0028,
"num_tokens": 390054241.0,
"reward": 1.0274023532867431,
"reward_std": 0.24801826775074004,
"rewards/reward_accuracy/mean": 0.928125,
"rewards/reward_accuracy/std": 0.24562657102942467,
"rewards/reward_format/mean": 0.09927734434604644,
"rewards/reward_format/std": 0.006919173197820783,
"sampling/importance_sampling_ratio/max": 2.477069878578186,
"sampling/importance_sampling_ratio/mean": 0.9831757187843323,
"sampling/importance_sampling_ratio/min": 0.08418161347508431,
"sampling/sampling_logp_difference/max": 0.947005671262741,
"sampling/sampling_logp_difference/mean": 0.004719699919223786,
"step": 3580,
"step_time": 8.90005328807456
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1862.9,
"completions/max_terminated_length": 1581.9,
"completions/mean_length": 183.81171875,
"completions/mean_terminated_length": 176.5430877685547,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.07487209462560714,
"epoch": 7.687366167023555,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.6953125,
"learning_rate": 9.641100000000002e-06,
"loss": -0.0104,
"num_tokens": 391040863.0,
"reward": 1.0316406309604644,
"reward_std": 0.24393230751156808,
"rewards/reward_accuracy/mean": 0.93203125,
"rewards/reward_accuracy/std": 0.24248645678162575,
"rewards/reward_format/mean": 0.099609375,
"rewards/reward_format/std": 0.00464201879221946,
"sampling/importance_sampling_ratio/max": 2.5126524925231934,
"sampling/importance_sampling_ratio/mean": 0.9803758919239044,
"sampling/importance_sampling_ratio/min": 0.07837437689304352,
"sampling/sampling_logp_difference/max": 0.882181179523468,
"sampling/sampling_logp_difference/mean": 0.005024082958698273,
"step": 3590,
"step_time": 8.84325868258602
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 1413.3,
"completions/max_terminated_length": 1367.7,
"completions/mean_length": 153.744140625,
"completions/mean_terminated_length": 153.01878204345704,
"completions/min_length": 63.7,
"completions/min_terminated_length": 63.7,
"entropy": 0.06162530113942921,
"epoch": 7.708779443254818,
"frac_reward_zero_std": 0.8125,
"grad_norm": 0.486328125,
"learning_rate": 9.640100000000001e-06,
"loss": -0.0065,
"num_tokens": 391952880.0,
"reward": 1.0361523509025574,
"reward_std": 0.23276183232665063,
"rewards/reward_accuracy/mean": 0.936328125,
"rewards/reward_accuracy/std": 0.23221236988902091,
"rewards/reward_format/mean": 0.09982421919703484,
"rewards/reward_format/std": 0.00199988700915128,
"sampling/importance_sampling_ratio/max": 2.4381773471832275,
"sampling/importance_sampling_ratio/mean": 0.9946589350700379,
"sampling/importance_sampling_ratio/min": 0.07329367585480213,
"sampling/sampling_logp_difference/max": 0.9881549894809722,
"sampling/sampling_logp_difference/mean": 0.004518144554458559,
"step": 3600,
"step_time": 6.866538394390955
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1541.2,
"completions/max_terminated_length": 1313.8,
"completions/mean_length": 182.4,
"completions/mean_terminated_length": 164.1815383911133,
"completions/min_length": 59.4,
"completions/min_terminated_length": 59.4,
"entropy": 0.07097981446422637,
"epoch": 7.730192719486081,
"frac_reward_zero_std": 0.8125,
"grad_norm": 0.5703125,
"learning_rate": 9.6391e-06,
"loss": -0.0037,
"num_tokens": 392939104.0,
"reward": 1.0351367473602295,
"reward_std": 0.23881253004074096,
"rewards/reward_accuracy/mean": 0.9359375,
"rewards/reward_accuracy/std": 0.23561812788248063,
"rewards/reward_format/mean": 0.09919922053813934,
"rewards/reward_format/std": 0.006413435004651547,
"sampling/importance_sampling_ratio/max": 2.6525344610214234,
"sampling/importance_sampling_ratio/mean": 0.9833298921585083,
"sampling/importance_sampling_ratio/min": 0.05296989688649774,
"sampling/sampling_logp_difference/max": 0.9195618748664856,
"sampling/sampling_logp_difference/mean": 0.004944087658077479,
"step": 3610,
"step_time": 7.557211775402538
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1736.9,
"completions/max_terminated_length": 1619.9,
"completions/mean_length": 184.566796875,
"completions/mean_terminated_length": 174.36035766601563,
"completions/min_length": 68.2,
"completions/min_terminated_length": 68.2,
"entropy": 0.07384573463350534,
"epoch": 7.751605995717345,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.5625,
"learning_rate": 9.6381e-06,
"loss": -0.0076,
"num_tokens": 393937227.0,
"reward": 0.993437510728836,
"reward_std": 0.29238147512078283,
"rewards/reward_accuracy/mean": 0.894140625,
"rewards/reward_accuracy/std": 0.29034136310219766,
"rewards/reward_format/mean": 0.09929687604308128,
"rewards/reward_format/std": 0.005527540226466954,
"sampling/importance_sampling_ratio/max": 2.4159623861312864,
"sampling/importance_sampling_ratio/mean": 0.9724921345710754,
"sampling/importance_sampling_ratio/min": 0.021895610028877854,
"sampling/sampling_logp_difference/max": 1.036386638879776,
"sampling/sampling_logp_difference/mean": 0.005005701188929379,
"step": 3620,
"step_time": 8.491100533597637
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1622.1,
"completions/max_terminated_length": 1377.2,
"completions/mean_length": 191.89765625,
"completions/mean_terminated_length": 173.2733169555664,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.07273952085524797,
"epoch": 7.773019271948608,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.263671875,
"learning_rate": 9.6371e-06,
"loss": -0.007,
"num_tokens": 394946501.0,
"reward": 1.0200586140155792,
"reward_std": 0.2624057486653328,
"rewards/reward_accuracy/mean": 0.92109375,
"rewards/reward_accuracy/std": 0.25927504748106,
"rewards/reward_format/mean": 0.09896484389901161,
"rewards/reward_format/std": 0.006811006413772702,
"sampling/importance_sampling_ratio/max": 2.4956888437271116,
"sampling/importance_sampling_ratio/mean": 0.9809256136417389,
"sampling/importance_sampling_ratio/min": 0.0752164799720049,
"sampling/sampling_logp_difference/max": 0.954933226108551,
"sampling/sampling_logp_difference/mean": 0.004880118020810187,
"step": 3630,
"step_time": 8.053718394509634
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1883.7,
"completions/max_terminated_length": 1488.8,
"completions/mean_length": 197.656640625,
"completions/mean_terminated_length": 181.68404388427734,
"completions/min_length": 71.1,
"completions/min_terminated_length": 71.1,
"entropy": 0.07658664807677269,
"epoch": 7.794432548179872,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.25,
"learning_rate": 9.6361e-06,
"loss": -0.0104,
"num_tokens": 395977062.0,
"reward": 1.0218945562839508,
"reward_std": 0.2440083459019661,
"rewards/reward_accuracy/mean": 0.92265625,
"rewards/reward_accuracy/std": 0.24121633172035217,
"rewards/reward_format/mean": 0.09923828318715096,
"rewards/reward_format/std": 0.006383325299248099,
"sampling/importance_sampling_ratio/max": 2.5979174613952636,
"sampling/importance_sampling_ratio/mean": 0.974828165769577,
"sampling/importance_sampling_ratio/min": 0.01637764656916261,
"sampling/sampling_logp_difference/max": 1.1134831428527832,
"sampling/sampling_logp_difference/mean": 0.005246490146964789,
"step": 3640,
"step_time": 8.961128801983431
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1902.5,
"completions/max_terminated_length": 1825.8,
"completions/mean_length": 211.565625,
"completions/mean_terminated_length": 194.54564056396484,
"completions/min_length": 61.9,
"completions/min_terminated_length": 61.9,
"entropy": 0.08680205158889294,
"epoch": 7.815845824411135,
"frac_reward_zero_std": 0.78125,
"grad_norm": 0.88671875,
"learning_rate": 9.6351e-06,
"loss": -0.0127,
"num_tokens": 397040318.0,
"reward": 0.9910742282867432,
"reward_std": 0.303937791287899,
"rewards/reward_accuracy/mean": 0.8921875,
"rewards/reward_accuracy/std": 0.301007391512394,
"rewards/reward_format/mean": 0.09888671934604645,
"rewards/reward_format/std": 0.007982184877619147,
"sampling/importance_sampling_ratio/max": 2.5114677429199217,
"sampling/importance_sampling_ratio/mean": 0.9812928259372711,
"sampling/importance_sampling_ratio/min": 0.04791516810655594,
"sampling/sampling_logp_difference/max": 0.85448357462883,
"sampling/sampling_logp_difference/mean": 0.005207560583949089,
"step": 3650,
"step_time": 9.59593158919888
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.819166113316896e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.819166113316896e-06,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1321.8,
"completions/max_terminated_length": 1175.3,
"completions/mean_length": 186.241015625,
"completions/mean_terminated_length": 169.10425872802733,
"completions/min_length": 65.3,
"completions/min_terminated_length": 65.3,
"entropy": 0.0710672412533313,
"epoch": 7.837259100642398,
"frac_reward_zero_std": 0.7875,
"grad_norm": 0.65625,
"learning_rate": 9.634100000000001e-06,
"loss": -0.0074,
"num_tokens": 398028759.0,
"reward": 0.9987500309944153,
"reward_std": 0.27971908673644064,
"rewards/reward_accuracy/mean": 0.899609375,
"rewards/reward_accuracy/std": 0.27756142392754557,
"rewards/reward_format/mean": 0.09914062544703484,
"rewards/reward_format/std": 0.005712301400490105,
"sampling/importance_sampling_ratio/max": 2.516208219528198,
"sampling/importance_sampling_ratio/mean": 0.9828593611717225,
"sampling/importance_sampling_ratio/min": 0.1660709038376808,
"sampling/sampling_logp_difference/max": 0.8381636142730713,
"sampling/sampling_logp_difference/mean": 0.004968195478431881,
"step": 3660,
"step_time": 6.694674244601629
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1703.3,
"completions/max_terminated_length": 1525.9,
"completions/mean_length": 200.278125,
"completions/mean_terminated_length": 182.94378356933595,
"completions/min_length": 63.7,
"completions/min_terminated_length": 63.7,
"entropy": 0.07680323896929622,
"epoch": 7.8586723768736615,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.5703125,
"learning_rate": 9.633100000000001e-06,
"loss": -0.0019,
"num_tokens": 399056143.0,
"reward": 1.0061328172683717,
"reward_std": 0.25569341629743575,
"rewards/reward_accuracy/mean": 0.90703125,
"rewards/reward_accuracy/std": 0.25296593010425567,
"rewards/reward_format/mean": 0.09910156279802322,
"rewards/reward_format/std": 0.006601125723682344,
"sampling/importance_sampling_ratio/max": 2.408440613746643,
"sampling/importance_sampling_ratio/mean": 0.9852367758750915,
"sampling/importance_sampling_ratio/min": 0.08956236690282822,
"sampling/sampling_logp_difference/max": 0.8555589020252228,
"sampling/sampling_logp_difference/mean": 0.00488103877287358,
"step": 3670,
"step_time": 8.498199324894813
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 2022.1,
"completions/max_terminated_length": 1577.4,
"completions/mean_length": 181.386328125,
"completions/mean_terminated_length": 170.41501159667968,
"completions/min_length": 61.2,
"completions/min_terminated_length": 61.2,
"entropy": 0.07189276609569788,
"epoch": 7.880085653104925,
"frac_reward_zero_std": 0.76875,
"grad_norm": 0.65625,
"learning_rate": 9.6321e-06,
"loss": -0.0127,
"num_tokens": 400038796.0,
"reward": 1.0296094000339509,
"reward_std": 0.2437703162431717,
"rewards/reward_accuracy/mean": 0.930078125,
"rewards/reward_accuracy/std": 0.24181726574897766,
"rewards/reward_format/mean": 0.0995312511920929,
"rewards/reward_format/std": 0.005712272552773357,
"sampling/importance_sampling_ratio/max": 2.4558380603790284,
"sampling/importance_sampling_ratio/mean": 0.9910882115364075,
"sampling/importance_sampling_ratio/min": 0.03984439447522163,
"sampling/sampling_logp_difference/max": 0.9436381161212921,
"sampling/sampling_logp_difference/mean": 0.004988160962238908,
"step": 3680,
"step_time": 9.493378731410484
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1724.5,
"completions/max_terminated_length": 1154.7,
"completions/mean_length": 171.28125,
"completions/mean_terminated_length": 165.44564819335938,
"completions/min_length": 69.7,
"completions/min_terminated_length": 69.7,
"entropy": 0.0719589474145323,
"epoch": 7.901498929336189,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.75390625,
"learning_rate": 9.631100000000002e-06,
"loss": -0.0005,
"num_tokens": 400996140.0,
"reward": 1.012187522649765,
"reward_std": 0.25294241309165955,
"rewards/reward_accuracy/mean": 0.9125,
"rewards/reward_accuracy/std": 0.25202185809612276,
"rewards/reward_format/mean": 0.09968750104308129,
"rewards/reward_format/std": 0.003634945582598448,
"sampling/importance_sampling_ratio/max": 2.2970234632492064,
"sampling/importance_sampling_ratio/mean": 0.9807588636875153,
"sampling/importance_sampling_ratio/min": 0.13293177597224712,
"sampling/sampling_logp_difference/max": 0.8728315591812134,
"sampling/sampling_logp_difference/mean": 0.004985981550998986,
"step": 3690,
"step_time": 7.96694088280492
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1504.6,
"completions/max_terminated_length": 1418.0,
"completions/mean_length": 186.7109375,
"completions/mean_terminated_length": 175.95427703857422,
"completions/min_length": 62.1,
"completions/min_terminated_length": 62.1,
"entropy": 0.07433808813802897,
"epoch": 7.922912205567452,
"frac_reward_zero_std": 0.8125,
"grad_norm": 0.96484375,
"learning_rate": 9.630100000000001e-06,
"loss": -0.0089,
"num_tokens": 401998536.0,
"reward": 1.0114648580551147,
"reward_std": 0.2568421721458435,
"rewards/reward_accuracy/mean": 0.912109375,
"rewards/reward_accuracy/std": 0.2552545391023159,
"rewards/reward_format/mean": 0.09935546964406967,
"rewards/reward_format/std": 0.004978313413448632,
"sampling/importance_sampling_ratio/max": 2.4995922803878785,
"sampling/importance_sampling_ratio/mean": 0.9829632818698884,
"sampling/importance_sampling_ratio/min": 0.08666891697794199,
"sampling/sampling_logp_difference/max": 0.7658428430557251,
"sampling/sampling_logp_difference/mean": 0.005094771878793836,
"step": 3700,
"step_time": 7.329949528616271
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1762.6,
"completions/max_terminated_length": 1571.9,
"completions/mean_length": 199.070703125,
"completions/mean_terminated_length": 186.23992767333985,
"completions/min_length": 61.1,
"completions/min_terminated_length": 61.1,
"entropy": 0.07969725895673037,
"epoch": 7.944325481798716,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.6953125,
"learning_rate": 9.6291e-06,
"loss": -0.0033,
"num_tokens": 403020429.0,
"reward": 1.0263476729393006,
"reward_std": 0.24410187900066377,
"rewards/reward_accuracy/mean": 0.926953125,
"rewards/reward_accuracy/std": 0.2422624871134758,
"rewards/reward_format/mean": 0.09939453229308129,
"rewards/reward_format/std": 0.004947800538502634,
"sampling/importance_sampling_ratio/max": 2.3103965640068056,
"sampling/importance_sampling_ratio/mean": 0.9862733900547027,
"sampling/importance_sampling_ratio/min": 0.07895481958985329,
"sampling/sampling_logp_difference/max": 0.7938117921352387,
"sampling/sampling_logp_difference/mean": 0.005103780189529061,
"step": 3710,
"step_time": 8.465698415998485
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1668.6,
"completions/max_terminated_length": 1502.2,
"completions/mean_length": 183.2171875,
"completions/mean_terminated_length": 171.04286193847656,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.07522350461222231,
"epoch": 7.965738758029978,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.6875,
"learning_rate": 9.628100000000002e-06,
"loss": -0.0078,
"num_tokens": 404006905.0,
"reward": 1.0255468666553498,
"reward_std": 0.24899236112833023,
"rewards/reward_accuracy/mean": 0.926171875,
"rewards/reward_accuracy/std": 0.2472747214138508,
"rewards/reward_format/mean": 0.09937499985098838,
"rewards/reward_format/std": 0.0054496222408488395,
"sampling/importance_sampling_ratio/max": 2.4028526544570923,
"sampling/importance_sampling_ratio/mean": 0.971779876947403,
"sampling/importance_sampling_ratio/min": 0.06447021961212158,
"sampling/sampling_logp_difference/max": 1.0346944272518157,
"sampling/sampling_logp_difference/mean": 0.005029352009296417,
"step": 3720,
"step_time": 8.072778747498523
},
{
"clip_ratio/high_max": 9.1552734375e-06,
"clip_ratio/high_mean": 1.1444091796875e-06,
"clip_ratio/low_mean": 4.011108376289485e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 5.155517555976985e-06,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1908.8,
"completions/max_terminated_length": 1646.3,
"completions/mean_length": 195.17734375,
"completions/mean_terminated_length": 174.70513458251952,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"entropy": 0.07118748272769153,
"epoch": 7.987152034261242,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.404296875,
"learning_rate": 9.6271e-06,
"loss": -0.0129,
"num_tokens": 405020543.0,
"reward": 1.0153711199760438,
"reward_std": 0.2749387174844742,
"rewards/reward_accuracy/mean": 0.91640625,
"rewards/reward_accuracy/std": 0.27147911190986634,
"rewards/reward_format/mean": 0.09896484464406967,
"rewards/reward_format/std": 0.007013841788284481,
"sampling/importance_sampling_ratio/max": 2.3268468499183657,
"sampling/importance_sampling_ratio/mean": 0.9711576759815216,
"sampling/importance_sampling_ratio/min": 0.02354610301554203,
"sampling/sampling_logp_difference/max": 0.8829498171806336,
"sampling/sampling_logp_difference/mean": 0.004902356583625078,
"step": 3730,
"step_time": 9.247705227797269
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1585.6,
"completions/max_terminated_length": 1469.5,
"completions/mean_length": 178.11015625,
"completions/mean_terminated_length": 170.1226608276367,
"completions/min_length": 69.9,
"completions/min_terminated_length": 69.9,
"entropy": 0.06943011377006769,
"epoch": 8.008565310492505,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.66796875,
"learning_rate": 9.626100000000001e-06,
"loss": -0.0075,
"num_tokens": 405997657.0,
"reward": 1.0151367366313935,
"reward_std": 0.2644330531358719,
"rewards/reward_accuracy/mean": 0.915625,
"rewards/reward_accuracy/std": 0.2630834482610226,
"rewards/reward_format/mean": 0.09951172024011612,
"rewards/reward_format/std": 0.004223581124097109,
"sampling/importance_sampling_ratio/max": 2.6009578466415406,
"sampling/importance_sampling_ratio/mean": 0.9898089349269867,
"sampling/importance_sampling_ratio/min": 0.10675678215920925,
"sampling/sampling_logp_difference/max": 0.7498188316822052,
"sampling/sampling_logp_difference/mean": 0.004846835159696639,
"step": 3740,
"step_time": 7.76293811298674
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.013671875,
"completions/max_length": 1525.4,
"completions/max_terminated_length": 1308.7,
"completions/mean_length": 196.873046875,
"completions/mean_terminated_length": 171.40442962646483,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.07221182179637253,
"epoch": 8.029978586723768,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.1923828125,
"learning_rate": 9.6251e-06,
"loss": -0.0049,
"num_tokens": 407023716.0,
"reward": 1.0281054854393006,
"reward_std": 0.22869482561945914,
"rewards/reward_accuracy/mean": 0.929296875,
"rewards/reward_accuracy/std": 0.22519356682896613,
"rewards/reward_format/mean": 0.09880859628319741,
"rewards/reward_format/std": 0.007678109756670892,
"sampling/importance_sampling_ratio/max": 2.6184497833251954,
"sampling/importance_sampling_ratio/mean": 0.9955185294151306,
"sampling/importance_sampling_ratio/min": 0.056230538664385675,
"sampling/sampling_logp_difference/max": 1.3605676174163819,
"sampling/sampling_logp_difference/mean": 0.0050271323416382074,
"step": 3750,
"step_time": 7.80916282319522
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1355.2,
"completions/max_terminated_length": 1325.7,
"completions/mean_length": 172.155078125,
"completions/mean_terminated_length": 166.37023162841797,
"completions/min_length": 69.9,
"completions/min_terminated_length": 69.9,
"entropy": 0.06300332336686551,
"epoch": 8.051391862955033,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.0,
"learning_rate": 9.6241e-06,
"loss": -0.0029,
"num_tokens": 407984193.0,
"reward": 1.0425976812839508,
"reward_std": 0.19198148548603058,
"rewards/reward_accuracy/mean": 0.94296875,
"rewards/reward_accuracy/std": 0.19070358127355574,
"rewards/reward_format/mean": 0.09962890669703484,
"rewards/reward_format/std": 0.003335496480576694,
"sampling/importance_sampling_ratio/max": 2.411038029193878,
"sampling/importance_sampling_ratio/mean": 0.9854229629039765,
"sampling/importance_sampling_ratio/min": 0.14093984365463258,
"sampling/sampling_logp_difference/max": 1.0589303851127625,
"sampling/sampling_logp_difference/mean": 0.004798770183697343,
"step": 3760,
"step_time": 6.636301019290113
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1472.7,
"completions/max_terminated_length": 1255.5,
"completions/mean_length": 188.738671875,
"completions/mean_terminated_length": 171.95799407958984,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"entropy": 0.07154895877465606,
"epoch": 8.072805139186295,
"frac_reward_zero_std": 0.8125,
"grad_norm": 0.7265625,
"learning_rate": 9.623100000000001e-06,
"loss": -0.0027,
"num_tokens": 408987828.0,
"reward": 1.0284570574760437,
"reward_std": 0.24332563877105712,
"rewards/reward_accuracy/mean": 0.929296875,
"rewards/reward_accuracy/std": 0.24028788208961488,
"rewards/reward_format/mean": 0.09916015937924386,
"rewards/reward_format/std": 0.006636243313550949,
"sampling/importance_sampling_ratio/max": 2.4399747133255003,
"sampling/importance_sampling_ratio/mean": 0.9925406098365783,
"sampling/importance_sampling_ratio/min": 0.06600186359137297,
"sampling/sampling_logp_difference/max": 0.9295972764492035,
"sampling/sampling_logp_difference/mean": 0.004938566498458386,
"step": 3770,
"step_time": 7.337033506896114
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1808.9,
"completions/max_terminated_length": 1743.9,
"completions/mean_length": 191.507421875,
"completions/mean_terminated_length": 181.32374725341796,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.07426097993738949,
"epoch": 8.09421841541756,
"frac_reward_zero_std": 0.7875,
"grad_norm": 0.447265625,
"learning_rate": 9.6221e-06,
"loss": -0.0083,
"num_tokens": 410002199.0,
"reward": 1.0403515934944152,
"reward_std": 0.23262374550104142,
"rewards/reward_accuracy/mean": 0.941015625,
"rewards/reward_accuracy/std": 0.23009302020072936,
"rewards/reward_format/mean": 0.09933593943715095,
"rewards/reward_format/std": 0.005747985513880849,
"sampling/importance_sampling_ratio/max": 2.396500062942505,
"sampling/importance_sampling_ratio/mean": 0.9819609582424164,
"sampling/importance_sampling_ratio/min": 0.08978751078248023,
"sampling/sampling_logp_difference/max": 0.8196139693260193,
"sampling/sampling_logp_difference/mean": 0.004950267192907631,
"step": 3780,
"step_time": 8.595623963692924
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1439.2,
"completions/max_terminated_length": 1206.4,
"completions/mean_length": 183.865625,
"completions/mean_terminated_length": 178.82349243164063,
"completions/min_length": 67.8,
"completions/min_terminated_length": 67.8,
"entropy": 0.0743003737181425,
"epoch": 8.115631691648822,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.59765625,
"learning_rate": 9.621100000000002e-06,
"loss": -0.0072,
"num_tokens": 410991167.0,
"reward": 1.0492383003234864,
"reward_std": 0.1949968434870243,
"rewards/reward_accuracy/mean": 0.949609375,
"rewards/reward_accuracy/std": 0.19366877749562264,
"rewards/reward_format/mean": 0.09962890744209289,
"rewards/reward_format/std": 0.0030854525743052364,
"sampling/importance_sampling_ratio/max": 2.316741394996643,
"sampling/importance_sampling_ratio/mean": 0.9840766787528992,
"sampling/importance_sampling_ratio/min": 0.12593643963336945,
"sampling/sampling_logp_difference/max": 1.0400145888328551,
"sampling/sampling_logp_difference/mean": 0.004929111385717988,
"step": 3790,
"step_time": 6.94505109868769
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1687.8,
"completions/max_terminated_length": 1491.5,
"completions/mean_length": 200.145703125,
"completions/mean_terminated_length": 194.45872802734374,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"entropy": 0.08579575503244996,
"epoch": 8.137044967880085,
"frac_reward_zero_std": 0.80625,
"grad_norm": 0.71484375,
"learning_rate": 9.620100000000001e-06,
"loss": -0.0104,
"num_tokens": 412017892.0,
"reward": 1.015898460149765,
"reward_std": 0.2665177546441555,
"rewards/reward_accuracy/mean": 0.91640625,
"rewards/reward_accuracy/std": 0.26460591033101083,
"rewards/reward_format/mean": 0.09949218854308128,
"rewards/reward_format/std": 0.003872173675335944,
"sampling/importance_sampling_ratio/max": 2.498238277435303,
"sampling/importance_sampling_ratio/mean": 0.9729526996612549,
"sampling/importance_sampling_ratio/min": 0.08811372620984911,
"sampling/sampling_logp_difference/max": 0.8661998271942138,
"sampling/sampling_logp_difference/mean": 0.005292421439662576,
"step": 3800,
"step_time": 8.062254661292537
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1787.2,
"completions/max_terminated_length": 1694.4,
"completions/mean_length": 179.453125,
"completions/mean_terminated_length": 172.2001480102539,
"completions/min_length": 69.4,
"completions/min_terminated_length": 69.4,
"entropy": 0.0699522809125483,
"epoch": 8.15845824411135,
"frac_reward_zero_std": 0.80625,
"grad_norm": 0.431640625,
"learning_rate": 9.6191e-06,
"loss": -0.0047,
"num_tokens": 412997068.0,
"reward": 1.0351953268051148,
"reward_std": 0.23319539651274682,
"rewards/reward_accuracy/mean": 0.935546875,
"rewards/reward_accuracy/std": 0.2317265659570694,
"rewards/reward_format/mean": 0.09964843839406967,
"rewards/reward_format/std": 0.003943874104879797,
"sampling/importance_sampling_ratio/max": 2.4632247567176817,
"sampling/importance_sampling_ratio/mean": 0.9887737691402435,
"sampling/importance_sampling_ratio/min": 0.1253064639866352,
"sampling/sampling_logp_difference/max": 0.7952985286712646,
"sampling/sampling_logp_difference/mean": 0.005012022657319903,
"step": 3810,
"step_time": 8.52721339269774
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1638.7,
"completions/max_terminated_length": 1483.6,
"completions/mean_length": 197.644140625,
"completions/mean_terminated_length": 182.63299407958985,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.07350199185311794,
"epoch": 8.179871520342612,
"frac_reward_zero_std": 0.8125,
"grad_norm": 0.53125,
"learning_rate": 9.618100000000002e-06,
"loss": -0.0039,
"num_tokens": 414018909.0,
"reward": 1.0316601812839508,
"reward_std": 0.24444497749209404,
"rewards/reward_accuracy/mean": 0.932421875,
"rewards/reward_accuracy/std": 0.24194783195853234,
"rewards/reward_format/mean": 0.09923828318715096,
"rewards/reward_format/std": 0.005442573968321085,
"sampling/importance_sampling_ratio/max": 2.4400006532669067,
"sampling/importance_sampling_ratio/mean": 0.9712385058403015,
"sampling/importance_sampling_ratio/min": 0.0369969367980957,
"sampling/sampling_logp_difference/max": 0.8865834474563599,
"sampling/sampling_logp_difference/mean": 0.00511595313437283,
"step": 3820,
"step_time": 7.883831079900847
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.695616237564536e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.695616237564536e-06,
"completions/clipped_ratio": 0.013671875,
"completions/max_length": 1828.6,
"completions/max_terminated_length": 1542.0,
"completions/mean_length": 206.812890625,
"completions/mean_terminated_length": 181.43682708740235,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.0773765133228153,
"epoch": 8.201284796573876,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.44140625,
"learning_rate": 9.6171e-06,
"loss": -0.0123,
"num_tokens": 415057934.0,
"reward": 1.0415429830551148,
"reward_std": 0.20455780774354934,
"rewards/reward_accuracy/mean": 0.94296875,
"rewards/reward_accuracy/std": 0.19928285479545593,
"rewards/reward_format/mean": 0.09857421964406968,
"rewards/reward_format/std": 0.008766607963480055,
"sampling/importance_sampling_ratio/max": 2.4892223358154295,
"sampling/importance_sampling_ratio/mean": 0.9793963611125946,
"sampling/importance_sampling_ratio/min": 0.0759053148329258,
"sampling/sampling_logp_difference/max": 0.7881308674812317,
"sampling/sampling_logp_difference/mean": 0.005021690088324249,
"step": 3830,
"step_time": 9.035757993292645
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1829.6,
"completions/max_terminated_length": 1544.1,
"completions/mean_length": 188.71015625,
"completions/mean_terminated_length": 177.15206298828124,
"completions/min_length": 72.7,
"completions/min_terminated_length": 72.7,
"entropy": 0.06760606644675135,
"epoch": 8.222698072805139,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.57421875,
"learning_rate": 9.616100000000001e-06,
"loss": -0.0084,
"num_tokens": 416062168.0,
"reward": 1.0221484541893004,
"reward_std": 0.24884682297706603,
"rewards/reward_accuracy/mean": 0.92265625,
"rewards/reward_accuracy/std": 0.24753023833036422,
"rewards/reward_format/mean": 0.09949218854308128,
"rewards/reward_format/std": 0.004808784811757505,
"sampling/importance_sampling_ratio/max": 2.383756721019745,
"sampling/importance_sampling_ratio/mean": 0.9838458120822906,
"sampling/importance_sampling_ratio/min": 0.08062138017266988,
"sampling/sampling_logp_difference/max": 1.0957905769348144,
"sampling/sampling_logp_difference/mean": 0.004694525059312582,
"step": 3840,
"step_time": 8.704144650197122
},
{
"clip_ratio/high_max": 5.736576349590905e-06,
"clip_ratio/high_mean": 7.170720436988632e-07,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 7.170720436988632e-07,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1645.2,
"completions/max_terminated_length": 1470.3,
"completions/mean_length": 175.2703125,
"completions/mean_terminated_length": 162.42333526611327,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.06982489698566496,
"epoch": 8.244111349036402,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.2734375,
"learning_rate": 9.6151e-06,
"loss": -0.0028,
"num_tokens": 417010988.0,
"reward": 1.0687695145606995,
"reward_std": 0.13246805400121958,
"rewards/reward_accuracy/mean": 0.96953125,
"rewards/reward_accuracy/std": 0.12919119894504547,
"rewards/reward_format/mean": 0.09923828020691872,
"rewards/reward_format/std": 0.005630645924247802,
"sampling/importance_sampling_ratio/max": 2.4604464411735534,
"sampling/importance_sampling_ratio/mean": 0.9800289452075959,
"sampling/importance_sampling_ratio/min": 0.14102425277233124,
"sampling/sampling_logp_difference/max": 0.738605409860611,
"sampling/sampling_logp_difference/mean": 0.004553366731852293,
"step": 3850,
"step_time": 7.88873183959222
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1754.6,
"completions/max_terminated_length": 1470.2,
"completions/mean_length": 189.356640625,
"completions/mean_terminated_length": 177.79940338134764,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"entropy": 0.07271721512079239,
"epoch": 8.265524625267666,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.443359375,
"learning_rate": 9.6141e-06,
"loss": -0.0108,
"num_tokens": 418010205.0,
"reward": 1.0448437690734864,
"reward_std": 0.2059263564646244,
"rewards/reward_accuracy/mean": 0.9453125,
"rewards/reward_accuracy/std": 0.20452869310975075,
"rewards/reward_format/mean": 0.0995312511920929,
"rewards/reward_format/std": 0.004877268802374601,
"sampling/importance_sampling_ratio/max": 2.4859877586364747,
"sampling/importance_sampling_ratio/mean": 0.9890855073928833,
"sampling/importance_sampling_ratio/min": 0.11249641384929418,
"sampling/sampling_logp_difference/max": 0.7298532247543335,
"sampling/sampling_logp_difference/mean": 0.004915011115372181,
"step": 3860,
"step_time": 8.44713533669128
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.166284502891358e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.166284502891358e-06,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1407.2,
"completions/max_terminated_length": 1200.1,
"completions/mean_length": 178.163671875,
"completions/mean_terminated_length": 160.8449951171875,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.06384049714542925,
"epoch": 8.286937901498929,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.35546875,
"learning_rate": 9.613100000000001e-06,
"loss": -0.0044,
"num_tokens": 418983504.0,
"reward": 1.0336914300918578,
"reward_std": 0.20421729162335395,
"rewards/reward_accuracy/mean": 0.934375,
"rewards/reward_accuracy/std": 0.20205151587724685,
"rewards/reward_format/mean": 0.09931640774011612,
"rewards/reward_format/std": 0.005439209146425128,
"sampling/importance_sampling_ratio/max": 2.1786391139030457,
"sampling/importance_sampling_ratio/mean": 0.9914569735527039,
"sampling/importance_sampling_ratio/min": 0.1301325958222151,
"sampling/sampling_logp_difference/max": 0.8415071487426757,
"sampling/sampling_logp_difference/mean": 0.004722009086981416,
"step": 3870,
"step_time": 6.93250994119735
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.6320316212368196e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.6320316212368196e-07,
"completions/clipped_ratio": 0.015234375,
"completions/max_length": 1923.5,
"completions/max_terminated_length": 1572.8,
"completions/mean_length": 212.2453125,
"completions/mean_terminated_length": 183.70399627685546,
"completions/min_length": 68.5,
"completions/min_terminated_length": 68.5,
"entropy": 0.08596195597201586,
"epoch": 8.308351177730193,
"frac_reward_zero_std": 0.76875,
"grad_norm": 0.6875,
"learning_rate": 9.6121e-06,
"loss": -0.0175,
"num_tokens": 420052132.0,
"reward": 1.0248047053813933,
"reward_std": 0.2616369813680649,
"rewards/reward_accuracy/mean": 0.926171875,
"rewards/reward_accuracy/std": 0.2574577063322067,
"rewards/reward_format/mean": 0.09863281399011611,
"rewards/reward_format/std": 0.009164127707481384,
"sampling/importance_sampling_ratio/max": 2.376406955718994,
"sampling/importance_sampling_ratio/mean": 0.9800885498523713,
"sampling/importance_sampling_ratio/min": 0.034546265564858916,
"sampling/sampling_logp_difference/max": 0.8501515507698059,
"sampling/sampling_logp_difference/mean": 0.005309962038882077,
"step": 3880,
"step_time": 9.401333570608404
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1474.2,
"completions/max_terminated_length": 1252.5,
"completions/mean_length": 178.528125,
"completions/mean_terminated_length": 164.1713897705078,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.06993798855692149,
"epoch": 8.329764453961456,
"frac_reward_zero_std": 0.84375,
"grad_norm": 1.2265625,
"learning_rate": 9.6111e-06,
"loss": -0.0122,
"num_tokens": 421026572.0,
"reward": 1.0328515827655793,
"reward_std": 0.20451828911900521,
"rewards/reward_accuracy/mean": 0.93359375,
"rewards/reward_accuracy/std": 0.2021766223013401,
"rewards/reward_format/mean": 0.09925781339406967,
"rewards/reward_format/std": 0.005332645098678768,
"sampling/importance_sampling_ratio/max": 2.4349303126335142,
"sampling/importance_sampling_ratio/mean": 0.9814438104629517,
"sampling/importance_sampling_ratio/min": 0.10074777472764254,
"sampling/sampling_logp_difference/max": 0.8508667349815369,
"sampling/sampling_logp_difference/mean": 0.004740464221686125,
"step": 3890,
"step_time": 7.063987069696305
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1562.3,
"completions/max_terminated_length": 1279.9,
"completions/mean_length": 180.460546875,
"completions/mean_terminated_length": 166.06637573242188,
"completions/min_length": 63.7,
"completions/min_terminated_length": 63.7,
"entropy": 0.07143675475381314,
"epoch": 8.35117773019272,
"frac_reward_zero_std": 0.8,
"grad_norm": 1.78125,
"learning_rate": 9.610100000000001e-06,
"loss": -0.0042,
"num_tokens": 422005271.0,
"reward": 1.0300976634025574,
"reward_std": 0.22454202249646188,
"rewards/reward_accuracy/mean": 0.930859375,
"rewards/reward_accuracy/std": 0.222722440212965,
"rewards/reward_format/mean": 0.0992382824420929,
"rewards/reward_format/std": 0.005231644888408482,
"sampling/importance_sampling_ratio/max": 2.5581493377685547,
"sampling/importance_sampling_ratio/mean": 0.9809596836566925,
"sampling/importance_sampling_ratio/min": 0.1779646873474121,
"sampling/sampling_logp_difference/max": 1.0241119623184205,
"sampling/sampling_logp_difference/mean": 0.004843436344526708,
"step": 3900,
"step_time": 7.664473193811136
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1559.8,
"completions/max_terminated_length": 1203.2,
"completions/mean_length": 181.56875,
"completions/mean_terminated_length": 164.90804214477538,
"completions/min_length": 68.6,
"completions/min_terminated_length": 68.6,
"entropy": 0.06390762203373015,
"epoch": 8.372591006423983,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.494140625,
"learning_rate": 9.609100000000001e-06,
"loss": -0.0105,
"num_tokens": 422994951.0,
"reward": 1.0435937762260437,
"reward_std": 0.2121858298778534,
"rewards/reward_accuracy/mean": 0.944140625,
"rewards/reward_accuracy/std": 0.21010563671588897,
"rewards/reward_format/mean": 0.09945312663912773,
"rewards/reward_format/std": 0.0056636356981471184,
"sampling/importance_sampling_ratio/max": 2.365661323070526,
"sampling/importance_sampling_ratio/mean": 0.97733393907547,
"sampling/importance_sampling_ratio/min": 0.12254998236894607,
"sampling/sampling_logp_difference/max": 0.8287970066070557,
"sampling/sampling_logp_difference/mean": 0.004476143280044198,
"step": 3910,
"step_time": 7.708977076187148
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1843.0,
"completions/max_terminated_length": 1643.1,
"completions/mean_length": 194.553515625,
"completions/mean_terminated_length": 179.26622314453124,
"completions/min_length": 67.9,
"completions/min_terminated_length": 67.9,
"entropy": 0.07748389644548297,
"epoch": 8.394004282655246,
"frac_reward_zero_std": 0.76875,
"grad_norm": 1.15625,
"learning_rate": 9.608100000000002e-06,
"loss": -0.0112,
"num_tokens": 424015920.0,
"reward": 1.0034570574760437,
"reward_std": 0.2784928843379021,
"rewards/reward_accuracy/mean": 0.904296875,
"rewards/reward_accuracy/std": 0.2757194049656391,
"rewards/reward_format/mean": 0.09916015714406967,
"rewards/reward_format/std": 0.007132244668900967,
"sampling/importance_sampling_ratio/max": 2.4623198747634887,
"sampling/importance_sampling_ratio/mean": 0.9854971826076507,
"sampling/importance_sampling_ratio/min": 0.06901181600987912,
"sampling/sampling_logp_difference/max": 1.0886169791221618,
"sampling/sampling_logp_difference/mean": 0.005118034733459354,
"step": 3920,
"step_time": 9.034137371499673
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1845.3,
"completions/max_terminated_length": 1762.4,
"completions/mean_length": 190.980078125,
"completions/mean_terminated_length": 183.74281463623046,
"completions/min_length": 62.3,
"completions/min_terminated_length": 62.3,
"entropy": 0.07758473251014948,
"epoch": 8.41541755888651,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.8359375,
"learning_rate": 9.6071e-06,
"loss": -0.0014,
"num_tokens": 425027117.0,
"reward": 1.0134375274181366,
"reward_std": 0.27642889469861986,
"rewards/reward_accuracy/mean": 0.9140625,
"rewards/reward_accuracy/std": 0.27459491342306136,
"rewards/reward_format/mean": 0.09937500134110451,
"rewards/reward_format/std": 0.005601800233125687,
"sampling/importance_sampling_ratio/max": 2.6070643186569216,
"sampling/importance_sampling_ratio/mean": 0.9823592662811279,
"sampling/importance_sampling_ratio/min": 0.10000658109784126,
"sampling/sampling_logp_difference/max": 1.0834239363670348,
"sampling/sampling_logp_difference/mean": 0.005178120918571949,
"step": 3930,
"step_time": 8.898832417291123
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1959.8,
"completions/max_terminated_length": 1591.1,
"completions/mean_length": 224.67265625,
"completions/mean_terminated_length": 201.98232727050782,
"completions/min_length": 67.3,
"completions/min_terminated_length": 67.3,
"entropy": 0.08397505492903293,
"epoch": 8.436830835117773,
"frac_reward_zero_std": 0.76875,
"grad_norm": 0.12255859375,
"learning_rate": 9.606100000000001e-06,
"loss": -0.0141,
"num_tokens": 426124279.0,
"reward": 1.0112695515155792,
"reward_std": 0.27639982253313067,
"rewards/reward_accuracy/mean": 0.9125,
"rewards/reward_accuracy/std": 0.2727187409996986,
"rewards/reward_format/mean": 0.09876953214406967,
"rewards/reward_format/std": 0.008481117826886476,
"sampling/importance_sampling_ratio/max": 2.5127022743225096,
"sampling/importance_sampling_ratio/mean": 0.9737383365631104,
"sampling/importance_sampling_ratio/min": 0.03192863008007407,
"sampling/sampling_logp_difference/max": 1.0657266855239869,
"sampling/sampling_logp_difference/mean": 0.005136113776825368,
"step": 3940,
"step_time": 9.614063376691774
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1876.2,
"completions/max_terminated_length": 1688.0,
"completions/mean_length": 189.3,
"completions/mean_terminated_length": 181.42574005126954,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.06967864367179573,
"epoch": 8.458244111349037,
"frac_reward_zero_std": 0.85,
"grad_norm": 1.0859375,
"learning_rate": 9.6051e-06,
"loss": -0.0074,
"num_tokens": 427120199.0,
"reward": 1.021386730670929,
"reward_std": 0.2594269663095474,
"rewards/reward_accuracy/mean": 0.921875,
"rewards/reward_accuracy/std": 0.2578837856650352,
"rewards/reward_format/mean": 0.09951171949505806,
"rewards/reward_format/std": 0.0049661130644381045,
"sampling/importance_sampling_ratio/max": 2.455304718017578,
"sampling/importance_sampling_ratio/mean": 0.9951301515102386,
"sampling/importance_sampling_ratio/min": 0.1357402555644512,
"sampling/sampling_logp_difference/max": 0.7106410205364228,
"sampling/sampling_logp_difference/mean": 0.004770952160470188,
"step": 3950,
"step_time": 8.8741878793051
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1952.1,
"completions/max_terminated_length": 1644.1,
"completions/mean_length": 200.442578125,
"completions/mean_terminated_length": 189.04503479003907,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.07980867228470742,
"epoch": 8.4796573875803,
"frac_reward_zero_std": 0.80625,
"grad_norm": 0.5234375,
"learning_rate": 9.6041e-06,
"loss": -0.0086,
"num_tokens": 428150100.0,
"reward": 1.0184766113758088,
"reward_std": 0.24089953526854516,
"rewards/reward_accuracy/mean": 0.919140625,
"rewards/reward_accuracy/std": 0.23903272673487663,
"rewards/reward_format/mean": 0.09933594018220901,
"rewards/reward_format/std": 0.005708382441662252,
"sampling/importance_sampling_ratio/max": 2.5080237865447996,
"sampling/importance_sampling_ratio/mean": 0.9774595856666565,
"sampling/importance_sampling_ratio/min": 0.10878601185977459,
"sampling/sampling_logp_difference/max": 0.865550059080124,
"sampling/sampling_logp_difference/mean": 0.005046690371818841,
"step": 3960,
"step_time": 9.416844888884224
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 1515.6,
"completions/max_terminated_length": 1343.1,
"completions/mean_length": 196.780859375,
"completions/mean_terminated_length": 175.0901092529297,
"completions/min_length": 65.2,
"completions/min_terminated_length": 65.2,
"entropy": 0.07728840708732605,
"epoch": 8.501070663811563,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.9453125,
"learning_rate": 9.603100000000001e-06,
"loss": -0.0055,
"num_tokens": 429167651.0,
"reward": 1.0254297256469727,
"reward_std": 0.25077923238277433,
"rewards/reward_accuracy/mean": 0.9265625,
"rewards/reward_accuracy/std": 0.24722943007946013,
"rewards/reward_format/mean": 0.09886718988418579,
"rewards/reward_format/std": 0.0072024350985884665,
"sampling/importance_sampling_ratio/max": 2.5038662433624266,
"sampling/importance_sampling_ratio/mean": 0.9730736672878265,
"sampling/importance_sampling_ratio/min": 0.06485747955739499,
"sampling/sampling_logp_difference/max": 0.848358690738678,
"sampling/sampling_logp_difference/mean": 0.005031507695093751,
"step": 3970,
"step_time": 7.686216593967401
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0140625,
"completions/max_length": 1890.7,
"completions/max_terminated_length": 1728.2,
"completions/mean_length": 240.053515625,
"completions/mean_terminated_length": 214.4836654663086,
"completions/min_length": 72.6,
"completions/min_terminated_length": 72.6,
"entropy": 0.10050115650519728,
"epoch": 8.522483940042827,
"frac_reward_zero_std": 0.75625,
"grad_norm": 0.61328125,
"learning_rate": 9.6021e-06,
"loss": -0.0132,
"num_tokens": 430300844.0,
"reward": 0.9772070527076722,
"reward_std": 0.3264451563358307,
"rewards/reward_accuracy/mean": 0.878515625,
"rewards/reward_accuracy/std": 0.32296623289585114,
"rewards/reward_format/mean": 0.0986914061009884,
"rewards/reward_format/std": 0.00897473730146885,
"sampling/importance_sampling_ratio/max": 2.5546274900436403,
"sampling/importance_sampling_ratio/mean": 0.9727532386779785,
"sampling/importance_sampling_ratio/min": 0.052880217880010606,
"sampling/sampling_logp_difference/max": 0.9698717713356018,
"sampling/sampling_logp_difference/mean": 0.0058213748503476385,
"step": 3980,
"step_time": 9.246698382688919
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.313123602310952e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.313123602310952e-06,
"completions/clipped_ratio": 0.012109375,
"completions/max_length": 1648.1,
"completions/max_terminated_length": 1426.6,
"completions/mean_length": 202.11640625,
"completions/mean_terminated_length": 179.9396499633789,
"completions/min_length": 63.9,
"completions/min_terminated_length": 63.9,
"entropy": 0.0814905168954283,
"epoch": 8.54389721627409,
"frac_reward_zero_std": 0.7875,
"grad_norm": 0.38671875,
"learning_rate": 9.6011e-06,
"loss": -0.0132,
"num_tokens": 431341174.0,
"reward": 1.0192773818969727,
"reward_std": 0.24714337140321732,
"rewards/reward_accuracy/mean": 0.9203125,
"rewards/reward_accuracy/std": 0.24442936480045319,
"rewards/reward_format/mean": 0.09896484687924385,
"rewards/reward_format/std": 0.0067655386868864294,
"sampling/importance_sampling_ratio/max": 2.3497997522354126,
"sampling/importance_sampling_ratio/mean": 0.9792013943195343,
"sampling/importance_sampling_ratio/min": 0.10589976459741593,
"sampling/sampling_logp_difference/max": 0.8358288645744324,
"sampling/sampling_logp_difference/mean": 0.005177208012901247,
"step": 3990,
"step_time": 8.010733946916298
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1546.3,
"completions/max_terminated_length": 1340.5,
"completions/mean_length": 181.44375,
"completions/mean_terminated_length": 173.48560943603516,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"entropy": 0.06296032280661165,
"epoch": 8.565310492505354,
"frac_reward_zero_std": 0.80625,
"grad_norm": 0.7265625,
"learning_rate": 9.600100000000001e-06,
"loss": 0.0033,
"num_tokens": 432322054.0,
"reward": 1.0268554747104646,
"reward_std": 0.22845394164323807,
"rewards/reward_accuracy/mean": 0.92734375,
"rewards/reward_accuracy/std": 0.2271147698163986,
"rewards/reward_format/mean": 0.09951171949505806,
"rewards/reward_format/std": 0.004677628423087299,
"sampling/importance_sampling_ratio/max": 2.556311082839966,
"sampling/importance_sampling_ratio/mean": 0.9950194895267487,
"sampling/importance_sampling_ratio/min": 0.14218476838432254,
"sampling/sampling_logp_difference/max": 0.8772651851177216,
"sampling/sampling_logp_difference/mean": 0.004379116953350604,
"step": 4000,
"step_time": 7.426540794785251
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012109375,
"completions/max_length": 1729.3,
"completions/max_terminated_length": 1464.7,
"completions/mean_length": 205.79296875,
"completions/mean_terminated_length": 183.3709732055664,
"completions/min_length": 63.9,
"completions/min_terminated_length": 63.9,
"entropy": 0.07609832077287138,
"epoch": 8.586723768736617,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.0888671875,
"learning_rate": 9.599100000000001e-06,
"loss": -0.0082,
"num_tokens": 433363348.0,
"reward": 1.0269922137260437,
"reward_std": 0.23816928043961524,
"rewards/reward_accuracy/mean": 0.928125,
"rewards/reward_accuracy/std": 0.23437619879841803,
"rewards/reward_format/mean": 0.09886718913912773,
"rewards/reward_format/std": 0.008243886311538518,
"sampling/importance_sampling_ratio/max": 2.4413416147232057,
"sampling/importance_sampling_ratio/mean": 0.9749242007732392,
"sampling/importance_sampling_ratio/min": 0.02793920426047407,
"sampling/sampling_logp_difference/max": 1.5374835014343262,
"sampling/sampling_logp_difference/mean": 0.005088918935507536,
"step": 4010,
"step_time": 8.61144763280463
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1530.1,
"completions/max_terminated_length": 1384.5,
"completions/mean_length": 179.559765625,
"completions/mean_terminated_length": 170.25837249755858,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"entropy": 0.07398475464433432,
"epoch": 8.60813704496788,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.2060546875,
"learning_rate": 9.5981e-06,
"loss": -0.0074,
"num_tokens": 434329085.0,
"reward": 1.0613476634025574,
"reward_std": 0.17295578494668007,
"rewards/reward_accuracy/mean": 0.96171875,
"rewards/reward_accuracy/std": 0.1716498427093029,
"rewards/reward_format/mean": 0.09962890669703484,
"rewards/reward_format/std": 0.0032693782122805715,
"sampling/importance_sampling_ratio/max": 2.373059260845184,
"sampling/importance_sampling_ratio/mean": 0.9771109223365784,
"sampling/importance_sampling_ratio/min": 0.1393841452896595,
"sampling/sampling_logp_difference/max": 0.8418267846107483,
"sampling/sampling_logp_difference/mean": 0.0048757056472823026,
"step": 4020,
"step_time": 7.261464487612829
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1832.8,
"completions/max_terminated_length": 1642.3,
"completions/mean_length": 211.766015625,
"completions/mean_terminated_length": 191.65030517578126,
"completions/min_length": 69.4,
"completions/min_terminated_length": 69.4,
"entropy": 0.08341751205734908,
"epoch": 8.629550321199144,
"frac_reward_zero_std": 0.76875,
"grad_norm": 0.3984375,
"learning_rate": 9.5971e-06,
"loss": -0.0155,
"num_tokens": 435396550.0,
"reward": 1.0284375488758086,
"reward_std": 0.24569795578718184,
"rewards/reward_accuracy/mean": 0.9296875,
"rewards/reward_accuracy/std": 0.2414251372218132,
"rewards/reward_format/mean": 0.09875000193715096,
"rewards/reward_format/std": 0.008118457533419133,
"sampling/importance_sampling_ratio/max": 2.495964288711548,
"sampling/importance_sampling_ratio/mean": 0.976284921169281,
"sampling/importance_sampling_ratio/min": 0.048086725547909735,
"sampling/sampling_logp_difference/max": 0.9342381715774536,
"sampling/sampling_logp_difference/mean": 0.005124957719817758,
"step": 4030,
"step_time": 9.05803453369008
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1526.0,
"completions/max_terminated_length": 1374.8,
"completions/mean_length": 184.896484375,
"completions/mean_terminated_length": 174.75355682373046,
"completions/min_length": 69.2,
"completions/min_terminated_length": 69.2,
"entropy": 0.06854445631615817,
"epoch": 8.650963597430406,
"frac_reward_zero_std": 0.8,
"grad_norm": 1.78125,
"learning_rate": 9.596100000000001e-06,
"loss": -0.0058,
"num_tokens": 436391037.0,
"reward": 1.028320324420929,
"reward_std": 0.2425820678472519,
"rewards/reward_accuracy/mean": 0.92890625,
"rewards/reward_accuracy/std": 0.24015701413154603,
"rewards/reward_format/mean": 0.09941406399011612,
"rewards/reward_format/std": 0.004634631285443902,
"sampling/importance_sampling_ratio/max": 2.5376546025276183,
"sampling/importance_sampling_ratio/mean": 0.9847315311431885,
"sampling/importance_sampling_ratio/min": 0.09038390293717384,
"sampling/sampling_logp_difference/max": 0.9430609822273255,
"sampling/sampling_logp_difference/mean": 0.004799716733396053,
"step": 4040,
"step_time": 7.640843277596287
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1630.0,
"completions/max_terminated_length": 1348.4,
"completions/mean_length": 184.33125,
"completions/mean_terminated_length": 169.1823715209961,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.07184867775067687,
"epoch": 8.67237687366167,
"frac_reward_zero_std": 0.7875,
"grad_norm": 0.341796875,
"learning_rate": 9.5951e-06,
"loss": -0.0081,
"num_tokens": 437386605.0,
"reward": 1.013671886920929,
"reward_std": 0.265979728102684,
"rewards/reward_accuracy/mean": 0.914453125,
"rewards/reward_accuracy/std": 0.26352960616350174,
"rewards/reward_format/mean": 0.09921875223517418,
"rewards/reward_format/std": 0.006192534929141402,
"sampling/importance_sampling_ratio/max": 2.32292640209198,
"sampling/importance_sampling_ratio/mean": 0.9877513289451599,
"sampling/importance_sampling_ratio/min": 0.11834248751401902,
"sampling/sampling_logp_difference/max": 0.7857591509819031,
"sampling/sampling_logp_difference/mean": 0.004978590877726674,
"step": 4050,
"step_time": 7.808451630306081
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1711.9,
"completions/max_terminated_length": 1546.4,
"completions/mean_length": 206.062109375,
"completions/mean_terminated_length": 183.15335693359376,
"completions/min_length": 62.3,
"completions/min_terminated_length": 62.3,
"entropy": 0.07774507557041943,
"epoch": 8.693790149892934,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.0,
"learning_rate": 9.5941e-06,
"loss": -0.0046,
"num_tokens": 438429612.0,
"reward": 1.02001953125,
"reward_std": 0.24380115419626236,
"rewards/reward_accuracy/mean": 0.92109375,
"rewards/reward_accuracy/std": 0.24089057743549347,
"rewards/reward_format/mean": 0.09892578199505805,
"rewards/reward_format/std": 0.007524332031607628,
"sampling/importance_sampling_ratio/max": 2.323392057418823,
"sampling/importance_sampling_ratio/mean": 0.9761070668697357,
"sampling/importance_sampling_ratio/min": 0.06003692373633385,
"sampling/sampling_logp_difference/max": 1.3186598777770997,
"sampling/sampling_logp_difference/mean": 0.004988841922022402,
"step": 4060,
"step_time": 8.849815206881612
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1465.0,
"completions/max_terminated_length": 1367.2,
"completions/mean_length": 173.391015625,
"completions/mean_terminated_length": 163.88512420654297,
"completions/min_length": 61.6,
"completions/min_terminated_length": 61.6,
"entropy": 0.065680799074471,
"epoch": 8.715203426124196,
"frac_reward_zero_std": 0.84375,
"grad_norm": 0.9765625,
"learning_rate": 9.593100000000001e-06,
"loss": -0.0104,
"num_tokens": 439391845.0,
"reward": 1.0479687750339508,
"reward_std": 0.19126022085547448,
"rewards/reward_accuracy/mean": 0.9484375,
"rewards/reward_accuracy/std": 0.1894942156970501,
"rewards/reward_format/mean": 0.0995312511920929,
"rewards/reward_format/std": 0.004577804310247302,
"sampling/importance_sampling_ratio/max": 2.500663924217224,
"sampling/importance_sampling_ratio/mean": 0.9716602683067321,
"sampling/importance_sampling_ratio/min": 0.12821342744864522,
"sampling/sampling_logp_difference/max": 0.9175853908061982,
"sampling/sampling_logp_difference/mean": 0.00478102108463645,
"step": 4070,
"step_time": 7.0291416218038645
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1974.9,
"completions/max_terminated_length": 1616.3,
"completions/mean_length": 198.715234375,
"completions/mean_terminated_length": 180.72380828857422,
"completions/min_length": 61.5,
"completions/min_terminated_length": 61.5,
"entropy": 0.0728057149797678,
"epoch": 8.73661670235546,
"frac_reward_zero_std": 0.80625,
"grad_norm": 0.703125,
"learning_rate": 9.592100000000001e-06,
"loss": -0.014,
"num_tokens": 440410620.0,
"reward": 1.0194921851158143,
"reward_std": 0.2574471816420555,
"rewards/reward_accuracy/mean": 0.9203125,
"rewards/reward_accuracy/std": 0.2540778636932373,
"rewards/reward_format/mean": 0.0991796873509884,
"rewards/reward_format/std": 0.007679479592479765,
"sampling/importance_sampling_ratio/max": 2.4311212420463564,
"sampling/importance_sampling_ratio/mean": 0.9844939053058624,
"sampling/importance_sampling_ratio/min": 0.02399395634420216,
"sampling/sampling_logp_difference/max": 0.9080464839935303,
"sampling/sampling_logp_difference/mean": 0.004943308117799461,
"step": 4080,
"step_time": 9.528803988685832
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1785.9,
"completions/max_terminated_length": 1578.5,
"completions/mean_length": 199.803125,
"completions/mean_terminated_length": 176.7684524536133,
"completions/min_length": 61.1,
"completions/min_terminated_length": 61.1,
"entropy": 0.0736522066872567,
"epoch": 8.758029978586723,
"frac_reward_zero_std": 0.8125,
"grad_norm": 0.337890625,
"learning_rate": 9.5911e-06,
"loss": -0.009,
"num_tokens": 441442692.0,
"reward": 1.0395898640155792,
"reward_std": 0.2044973760843277,
"rewards/reward_accuracy/mean": 0.940625,
"rewards/reward_accuracy/std": 0.20119093582034112,
"rewards/reward_format/mean": 0.09896484687924385,
"rewards/reward_format/std": 0.007301438599824905,
"sampling/importance_sampling_ratio/max": 2.4852211117744445,
"sampling/importance_sampling_ratio/mean": 0.9801795005798339,
"sampling/importance_sampling_ratio/min": 0.04223434627056122,
"sampling/sampling_logp_difference/max": 1.4710837364196778,
"sampling/sampling_logp_difference/mean": 0.004973637918010354,
"step": 4090,
"step_time": 8.85520198858867
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0234375,
"completions/max_length": 2019.4,
"completions/max_terminated_length": 1695.3,
"completions/mean_length": 253.19921875,
"completions/mean_terminated_length": 210.65961151123048,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.09033034853637219,
"epoch": 8.779443254817988,
"frac_reward_zero_std": 0.725,
"grad_norm": 0.51953125,
"learning_rate": 9.590100000000002e-06,
"loss": -0.0147,
"num_tokens": 442613618.0,
"reward": 1.001230490207672,
"reward_std": 0.27912717014551164,
"rewards/reward_accuracy/mean": 0.903515625,
"rewards/reward_accuracy/std": 0.27343803495168684,
"rewards/reward_format/mean": 0.09771484583616256,
"rewards/reward_format/std": 0.012519821478053927,
"sampling/importance_sampling_ratio/max": 2.4713290691375733,
"sampling/importance_sampling_ratio/mean": 0.9674436211585998,
"sampling/importance_sampling_ratio/min": 0.01774874087423086,
"sampling/sampling_logp_difference/max": 0.9002786576747894,
"sampling/sampling_logp_difference/mean": 0.005108398385345936,
"step": 4100,
"step_time": 10.424704754081905
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1604.1,
"completions/max_terminated_length": 1481.3,
"completions/mean_length": 201.362109375,
"completions/mean_terminated_length": 180.95695953369142,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.07696724054403603,
"epoch": 8.80085653104925,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.640625,
"learning_rate": 9.589100000000001e-06,
"loss": -0.005,
"num_tokens": 443649345.0,
"reward": 1.0141406536102295,
"reward_std": 0.26240924298763274,
"rewards/reward_accuracy/mean": 0.91484375,
"rewards/reward_accuracy/std": 0.260262542963028,
"rewards/reward_format/mean": 0.09929687678813934,
"rewards/reward_format/std": 0.0059063812019303445,
"sampling/importance_sampling_ratio/max": 2.6663366317749024,
"sampling/importance_sampling_ratio/mean": 0.9897813260555267,
"sampling/importance_sampling_ratio/min": 0.08131897486746312,
"sampling/sampling_logp_difference/max": 0.909190583229065,
"sampling/sampling_logp_difference/mean": 0.005112319486215711,
"step": 4110,
"step_time": 8.083047407519189
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1687.3,
"completions/max_terminated_length": 1503.8,
"completions/mean_length": 183.565234375,
"completions/mean_terminated_length": 168.24746704101562,
"completions/min_length": 60.8,
"completions/min_terminated_length": 60.8,
"entropy": 0.06688511986285448,
"epoch": 8.822269807280513,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.353515625,
"learning_rate": 9.5881e-06,
"loss": 0.0033,
"num_tokens": 444626952.0,
"reward": 1.0216211318969726,
"reward_std": 0.2403771162033081,
"rewards/reward_accuracy/mean": 0.922265625,
"rewards/reward_accuracy/std": 0.23827702403068543,
"rewards/reward_format/mean": 0.09935547187924385,
"rewards/reward_format/std": 0.005992095964029431,
"sampling/importance_sampling_ratio/max": 2.3876925706863403,
"sampling/importance_sampling_ratio/mean": 0.9742326855659484,
"sampling/importance_sampling_ratio/min": 0.10921804439276457,
"sampling/sampling_logp_difference/max": 0.9228575944900512,
"sampling/sampling_logp_difference/mean": 0.004566996730864048,
"step": 4120,
"step_time": 8.274038799511619
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1900.8,
"completions/max_terminated_length": 1614.1,
"completions/mean_length": 222.321875,
"completions/mean_terminated_length": 202.6423599243164,
"completions/min_length": 69.4,
"completions/min_terminated_length": 69.4,
"entropy": 0.08584995651617647,
"epoch": 8.843683083511777,
"frac_reward_zero_std": 0.75625,
"grad_norm": 0.384765625,
"learning_rate": 9.5871e-06,
"loss": -0.0038,
"num_tokens": 445714976.0,
"reward": 0.997148460149765,
"reward_std": 0.27114875242114067,
"rewards/reward_accuracy/mean": 0.898046875,
"rewards/reward_accuracy/std": 0.26893767043948175,
"rewards/reward_format/mean": 0.09910156354308128,
"rewards/reward_format/std": 0.006219938630238175,
"sampling/importance_sampling_ratio/max": 2.615603971481323,
"sampling/importance_sampling_ratio/mean": 0.9771971940994263,
"sampling/importance_sampling_ratio/min": 0.044926229491829874,
"sampling/sampling_logp_difference/max": 0.8742292821407318,
"sampling/sampling_logp_difference/mean": 0.005526069644838571,
"step": 4130,
"step_time": 9.20357839250064
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1418.2,
"completions/max_terminated_length": 1383.2,
"completions/mean_length": 191.581640625,
"completions/mean_terminated_length": 183.7728240966797,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.07666312428191305,
"epoch": 8.86509635974304,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.3125,
"learning_rate": 9.5861e-06,
"loss": -0.0047,
"num_tokens": 446720321.0,
"reward": 1.0359375178813934,
"reward_std": 0.21005870178341865,
"rewards/reward_accuracy/mean": 0.936328125,
"rewards/reward_accuracy/std": 0.20898194313049318,
"rewards/reward_format/mean": 0.099609375,
"rewards/reward_format/std": 0.0029540014453232287,
"sampling/importance_sampling_ratio/max": 2.439884090423584,
"sampling/importance_sampling_ratio/mean": 0.9864542126655579,
"sampling/importance_sampling_ratio/min": 0.15268897796049713,
"sampling/sampling_logp_difference/max": 0.7541396617889404,
"sampling/sampling_logp_difference/mean": 0.005160272074863315,
"step": 4140,
"step_time": 7.1034296500118215
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01484375,
"completions/max_length": 1422.3,
"completions/max_terminated_length": 1058.8,
"completions/mean_length": 193.60390625,
"completions/mean_terminated_length": 166.04514770507814,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.0674930130597204,
"epoch": 8.886509635974305,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.58203125,
"learning_rate": 9.5851e-06,
"loss": -0.0033,
"num_tokens": 447726347.0,
"reward": 1.0434180080890656,
"reward_std": 0.2049616739153862,
"rewards/reward_accuracy/mean": 0.94453125,
"rewards/reward_accuracy/std": 0.20151858329772948,
"rewards/reward_format/mean": 0.09888672083616257,
"rewards/reward_format/std": 0.006401264644227922,
"sampling/importance_sampling_ratio/max": 2.4204462289810182,
"sampling/importance_sampling_ratio/mean": 0.973732078075409,
"sampling/importance_sampling_ratio/min": 0.10520917326211929,
"sampling/sampling_logp_difference/max": 1.0631659388542176,
"sampling/sampling_logp_difference/mean": 0.004846474388614297,
"step": 4150,
"step_time": 7.235820112397778
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1691.2,
"completions/max_terminated_length": 1463.6,
"completions/mean_length": 194.4796875,
"completions/mean_terminated_length": 179.9914108276367,
"completions/min_length": 68.5,
"completions/min_terminated_length": 68.5,
"entropy": 0.07514401767402887,
"epoch": 8.907922912205567,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.86328125,
"learning_rate": 9.5841e-06,
"loss": -0.0223,
"num_tokens": 448742647.0,
"reward": 1.0234375,
"reward_std": 0.2503847308456898,
"rewards/reward_accuracy/mean": 0.92421875,
"rewards/reward_accuracy/std": 0.24786878600716591,
"rewards/reward_format/mean": 0.09921875149011612,
"rewards/reward_format/std": 0.006292355665937066,
"sampling/importance_sampling_ratio/max": 2.5087927341461183,
"sampling/importance_sampling_ratio/mean": 0.9829802691936493,
"sampling/importance_sampling_ratio/min": 0.10184253696352244,
"sampling/sampling_logp_difference/max": 1.0045469522476196,
"sampling/sampling_logp_difference/mean": 0.0050938359927386045,
"step": 4160,
"step_time": 8.402294135800911
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1193.5,
"completions/max_terminated_length": 1143.9,
"completions/mean_length": 168.161328125,
"completions/mean_terminated_length": 165.2590576171875,
"completions/min_length": 72.3,
"completions/min_terminated_length": 72.3,
"entropy": 0.06375126531347633,
"epoch": 8.929336188436832,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.373046875,
"learning_rate": 9.583100000000001e-06,
"loss": -0.0002,
"num_tokens": 449688564.0,
"reward": 1.0240234375,
"reward_std": 0.23299082666635512,
"rewards/reward_accuracy/mean": 0.92421875,
"rewards/reward_accuracy/std": 0.23235177174210547,
"rewards/reward_format/mean": 0.0998046875,
"rewards/reward_format/std": 0.0022331610787659885,
"sampling/importance_sampling_ratio/max": 2.44200404882431,
"sampling/importance_sampling_ratio/mean": 0.985089236497879,
"sampling/importance_sampling_ratio/min": 0.15358789563179015,
"sampling/sampling_logp_difference/max": 0.9894370079040528,
"sampling/sampling_logp_difference/mean": 0.004818607936613262,
"step": 4170,
"step_time": 5.825651186978211
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1771.3,
"completions/max_terminated_length": 1677.4,
"completions/mean_length": 206.755078125,
"completions/mean_terminated_length": 183.55651245117187,
"completions/min_length": 69.7,
"completions/min_terminated_length": 69.7,
"entropy": 0.08872145414352417,
"epoch": 8.950749464668094,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.58203125,
"learning_rate": 9.582100000000001e-06,
"loss": -0.011,
"num_tokens": 450731921.0,
"reward": 1.0164844155311585,
"reward_std": 0.2652391128242016,
"rewards/reward_accuracy/mean": 0.917578125,
"rewards/reward_accuracy/std": 0.2617250941693783,
"rewards/reward_format/mean": 0.0989062525331974,
"rewards/reward_format/std": 0.0071072856895625595,
"sampling/importance_sampling_ratio/max": 2.5181943655014036,
"sampling/importance_sampling_ratio/mean": 0.99248126745224,
"sampling/importance_sampling_ratio/min": 0.04991177674382925,
"sampling/sampling_logp_difference/max": 0.6847836911678314,
"sampling/sampling_logp_difference/mean": 0.005415957141667605,
"step": 4180,
"step_time": 8.775384242509608
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1783.7,
"completions/max_terminated_length": 1517.1,
"completions/mean_length": 203.744140625,
"completions/mean_terminated_length": 185.23631439208984,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.0812079954892397,
"epoch": 8.972162740899357,
"frac_reward_zero_std": 0.7375,
"grad_norm": 0.62890625,
"learning_rate": 9.5811e-06,
"loss": -0.0153,
"num_tokens": 451779794.0,
"reward": 1.0265820384025575,
"reward_std": 0.2419845297932625,
"rewards/reward_accuracy/mean": 0.92734375,
"rewards/reward_accuracy/std": 0.2395829439163208,
"rewards/reward_format/mean": 0.09923828095197677,
"rewards/reward_format/std": 0.005663045146502554,
"sampling/importance_sampling_ratio/max": 2.5486409187316896,
"sampling/importance_sampling_ratio/mean": 0.9742596626281739,
"sampling/importance_sampling_ratio/min": 0.033798061311244965,
"sampling/sampling_logp_difference/max": 0.9006427168846131,
"sampling/sampling_logp_difference/mean": 0.005345596559345722,
"step": 4190,
"step_time": 8.606992253498174
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1532.7,
"completions/max_terminated_length": 1412.1,
"completions/mean_length": 183.11015625,
"completions/mean_terminated_length": 167.85662231445312,
"completions/min_length": 68.5,
"completions/min_terminated_length": 68.5,
"entropy": 0.06734887049533426,
"epoch": 8.993576017130621,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.298828125,
"learning_rate": 9.580100000000002e-06,
"loss": -0.008,
"num_tokens": 452772252.0,
"reward": 1.033203160762787,
"reward_std": 0.24019818156957626,
"rewards/reward_accuracy/mean": 0.933984375,
"rewards/reward_accuracy/std": 0.23779146298766135,
"rewards/reward_format/mean": 0.09921875223517418,
"rewards/reward_format/std": 0.005174952792003751,
"sampling/importance_sampling_ratio/max": 2.4819756150245667,
"sampling/importance_sampling_ratio/mean": 0.9777391374111175,
"sampling/importance_sampling_ratio/min": 0.06980919614434242,
"sampling/sampling_logp_difference/max": 0.8308595716953278,
"sampling/sampling_logp_difference/mean": 0.004986388329416514,
"step": 4200,
"step_time": 7.41061211260967
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.011328125,
"completions/max_length": 1603.1,
"completions/max_terminated_length": 1513.6,
"completions/mean_length": 197.238671875,
"completions/mean_terminated_length": 176.27252044677735,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"entropy": 0.07113565308973194,
"epoch": 9.014989293361884,
"frac_reward_zero_std": 0.7875,
"grad_norm": 0.0,
"learning_rate": 9.579100000000001e-06,
"loss": -0.0162,
"num_tokens": 453795951.0,
"reward": 1.0224218964576721,
"reward_std": 0.245162745565176,
"rewards/reward_accuracy/mean": 0.9234375,
"rewards/reward_accuracy/std": 0.24227680191397666,
"rewards/reward_format/mean": 0.0989843763411045,
"rewards/reward_format/std": 0.007394557469524443,
"sampling/importance_sampling_ratio/max": 2.5241718769073485,
"sampling/importance_sampling_ratio/mean": 0.9850675821304321,
"sampling/importance_sampling_ratio/min": 0.07101124078035355,
"sampling/sampling_logp_difference/max": 0.9364025592803955,
"sampling/sampling_logp_difference/mean": 0.004974988382309675,
"step": 4210,
"step_time": 8.087014250695939
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1855.6,
"completions/max_terminated_length": 1387.8,
"completions/mean_length": 187.025390625,
"completions/mean_terminated_length": 169.6028045654297,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.06556996488943696,
"epoch": 9.036402569593148,
"frac_reward_zero_std": 0.80625,
"grad_norm": 0.94921875,
"learning_rate": 9.5781e-06,
"loss": -0.0038,
"num_tokens": 454789328.0,
"reward": 1.0444531619548798,
"reward_std": 0.21489887684583664,
"rewards/reward_accuracy/mean": 0.9453125,
"rewards/reward_accuracy/std": 0.21123108342289926,
"rewards/reward_format/mean": 0.09914062768220902,
"rewards/reward_format/std": 0.007097447849810123,
"sampling/importance_sampling_ratio/max": 2.4522717237472533,
"sampling/importance_sampling_ratio/mean": 0.9819264590740204,
"sampling/importance_sampling_ratio/min": 0.09280512817203998,
"sampling/sampling_logp_difference/max": 0.8345251679420471,
"sampling/sampling_logp_difference/mean": 0.004684854042716324,
"step": 4220,
"step_time": 8.835572460418916
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1640.0,
"completions/max_terminated_length": 1502.3,
"completions/mean_length": 179.45703125,
"completions/mean_terminated_length": 172.92357330322267,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.06249024085700512,
"epoch": 9.057815845824411,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.0,
"learning_rate": 9.5771e-06,
"loss": -0.0032,
"num_tokens": 455761874.0,
"reward": 1.0529687762260438,
"reward_std": 0.1920694440603256,
"rewards/reward_accuracy/mean": 0.953515625,
"rewards/reward_accuracy/std": 0.19044821858406066,
"rewards/reward_format/mean": 0.09945312663912773,
"rewards/reward_format/std": 0.005265423329547048,
"sampling/importance_sampling_ratio/max": 2.2460992097854615,
"sampling/importance_sampling_ratio/mean": 0.9842089414596558,
"sampling/importance_sampling_ratio/min": 0.04639969933778047,
"sampling/sampling_logp_difference/max": 0.8186712503433228,
"sampling/sampling_logp_difference/mean": 0.0045376317109912636,
"step": 4230,
"step_time": 8.057494014091208
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1637.0,
"completions/max_terminated_length": 1161.6,
"completions/mean_length": 179.034375,
"completions/mean_terminated_length": 160.75839538574218,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"entropy": 0.06559291896410287,
"epoch": 9.079229122055674,
"frac_reward_zero_std": 0.83125,
"grad_norm": 0.283203125,
"learning_rate": 9.5761e-06,
"loss": -0.0033,
"num_tokens": 456735994.0,
"reward": 1.0473633050918578,
"reward_std": 0.21428845822811127,
"rewards/reward_accuracy/mean": 0.948046875,
"rewards/reward_accuracy/std": 0.21142952367663384,
"rewards/reward_format/mean": 0.09931640774011612,
"rewards/reward_format/std": 0.00592591124586761,
"sampling/importance_sampling_ratio/max": 2.4966970920562743,
"sampling/importance_sampling_ratio/mean": 0.9920680463314057,
"sampling/importance_sampling_ratio/min": 0.1002632088959217,
"sampling/sampling_logp_difference/max": 0.7565010070800782,
"sampling/sampling_logp_difference/mean": 0.00467553292401135,
"step": 4240,
"step_time": 7.897679917892674
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1608.7,
"completions/max_terminated_length": 1473.5,
"completions/mean_length": 190.58046875,
"completions/mean_terminated_length": 172.5479507446289,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.06400286178104579,
"epoch": 9.100642398286938,
"frac_reward_zero_std": 0.78125,
"grad_norm": 0.26953125,
"learning_rate": 9.575100000000001e-06,
"loss": -0.0058,
"num_tokens": 457743384.0,
"reward": 1.0237304806709289,
"reward_std": 0.24830610901117325,
"rewards/reward_accuracy/mean": 0.924609375,
"rewards/reward_accuracy/std": 0.24561607837677002,
"rewards/reward_format/mean": 0.09912109524011611,
"rewards/reward_format/std": 0.006450834404677153,
"sampling/importance_sampling_ratio/max": 2.459565806388855,
"sampling/importance_sampling_ratio/mean": 0.9763280808925628,
"sampling/importance_sampling_ratio/min": 0.10000016912817955,
"sampling/sampling_logp_difference/max": 0.871113508939743,
"sampling/sampling_logp_difference/mean": 0.004656827286817133,
"step": 4250,
"step_time": 7.875724191599875
},
{
"clip_ratio/high_max": 5.805852197227068e-06,
"clip_ratio/high_mean": 7.257315246533835e-07,
"clip_ratio/low_mean": 1.088765907297784e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.8144974319511674e-06,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1612.2,
"completions/max_terminated_length": 1297.4,
"completions/mean_length": 191.607421875,
"completions/mean_terminated_length": 171.239013671875,
"completions/min_length": 65.3,
"completions/min_terminated_length": 65.3,
"entropy": 0.061286263773217796,
"epoch": 9.1220556745182,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.37109375,
"learning_rate": 9.5741e-06,
"loss": -0.0008,
"num_tokens": 458754507.0,
"reward": 1.0026758074760438,
"reward_std": 0.25933543816208837,
"rewards/reward_accuracy/mean": 0.903515625,
"rewards/reward_accuracy/std": 0.256686183065176,
"rewards/reward_format/mean": 0.09916015788912773,
"rewards/reward_format/std": 0.006677229423075914,
"sampling/importance_sampling_ratio/max": 2.3097979068756103,
"sampling/importance_sampling_ratio/mean": 0.981951767206192,
"sampling/importance_sampling_ratio/min": 0.13796920850872993,
"sampling/sampling_logp_difference/max": 0.8227352499961853,
"sampling/sampling_logp_difference/mean": 0.0043256452539935705,
"step": 4260,
"step_time": 7.852588194209966
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1775.9,
"completions/max_terminated_length": 1716.5,
"completions/mean_length": 203.18828125,
"completions/mean_terminated_length": 184.5071243286133,
"completions/min_length": 67.9,
"completions/min_terminated_length": 67.9,
"entropy": 0.0717295145848766,
"epoch": 9.143468950749465,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.87109375,
"learning_rate": 9.573100000000002e-06,
"loss": -0.007,
"num_tokens": 459802061.0,
"reward": 1.011894565820694,
"reward_std": 0.26872083693742754,
"rewards/reward_accuracy/mean": 0.912890625,
"rewards/reward_accuracy/std": 0.2658799603581429,
"rewards/reward_format/mean": 0.0990039087831974,
"rewards/reward_format/std": 0.006549866031855344,
"sampling/importance_sampling_ratio/max": 2.295648658275604,
"sampling/importance_sampling_ratio/mean": 0.9718441307544708,
"sampling/importance_sampling_ratio/min": 0.004501693695783615,
"sampling/sampling_logp_difference/max": 0.846879506111145,
"sampling/sampling_logp_difference/mean": 0.004800763307139277,
"step": 4270,
"step_time": 9.069937308097725
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1621.4,
"completions/max_terminated_length": 1393.5,
"completions/mean_length": 185.140234375,
"completions/mean_terminated_length": 180.07694396972656,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.06542770015075802,
"epoch": 9.164882226980728,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.95703125,
"learning_rate": 9.572100000000001e-06,
"loss": -0.0147,
"num_tokens": 460796740.0,
"reward": 1.025703138113022,
"reward_std": 0.23445182740688325,
"rewards/reward_accuracy/mean": 0.926171875,
"rewards/reward_accuracy/std": 0.23306241184473037,
"rewards/reward_format/mean": 0.09953125193715096,
"rewards/reward_format/std": 0.004565370851196349,
"sampling/importance_sampling_ratio/max": 2.491687369346619,
"sampling/importance_sampling_ratio/mean": 0.9831057071685791,
"sampling/importance_sampling_ratio/min": 0.07944684475660324,
"sampling/sampling_logp_difference/max": 1.025398278236389,
"sampling/sampling_logp_difference/mean": 0.004826760082505643,
"step": 4280,
"step_time": 7.591042720389669
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1680.2,
"completions/max_terminated_length": 1513.6,
"completions/mean_length": 188.204296875,
"completions/mean_terminated_length": 180.1913833618164,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.068529881676659,
"epoch": 9.18629550321199,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.1728515625,
"learning_rate": 9.5711e-06,
"loss": -0.0106,
"num_tokens": 461799407.0,
"reward": 1.021445345878601,
"reward_std": 0.24568369686603547,
"rewards/reward_accuracy/mean": 0.921875,
"rewards/reward_accuracy/std": 0.24375516995787622,
"rewards/reward_format/mean": 0.09957031458616257,
"rewards/reward_format/std": 0.004246706981211901,
"sampling/importance_sampling_ratio/max": 2.510874080657959,
"sampling/importance_sampling_ratio/mean": 0.9822835087776184,
"sampling/importance_sampling_ratio/min": 0.06078822426497936,
"sampling/sampling_logp_difference/max": 0.809979897737503,
"sampling/sampling_logp_difference/mean": 0.0048592002131044865,
"step": 4290,
"step_time": 8.073327824298758
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1771.1,
"completions/max_terminated_length": 1376.4,
"completions/mean_length": 188.257421875,
"completions/mean_terminated_length": 181.73468322753905,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.07184608271345497,
"epoch": 9.207708779443255,
"frac_reward_zero_std": 0.78125,
"grad_norm": 0.32421875,
"learning_rate": 9.570100000000002e-06,
"loss": -0.0043,
"num_tokens": 462795970.0,
"reward": 1.0249609410762788,
"reward_std": 0.25161722749471666,
"rewards/reward_accuracy/mean": 0.925390625,
"rewards/reward_accuracy/std": 0.250398313999176,
"rewards/reward_format/mean": 0.09957031384110451,
"rewards/reward_format/std": 0.004808470350690186,
"sampling/importance_sampling_ratio/max": 2.581635093688965,
"sampling/importance_sampling_ratio/mean": 0.9830692172050476,
"sampling/importance_sampling_ratio/min": 0.11820435635745526,
"sampling/sampling_logp_difference/max": 0.7528284668922425,
"sampling/sampling_logp_difference/mean": 0.004937404487282038,
"step": 4300,
"step_time": 8.365885337916552
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1655.0,
"completions/max_terminated_length": 1358.1,
"completions/mean_length": 173.15625,
"completions/mean_terminated_length": 165.10169219970703,
"completions/min_length": 69.1,
"completions/min_terminated_length": 69.1,
"entropy": 0.06470482423901558,
"epoch": 9.229122055674518,
"frac_reward_zero_std": 0.80625,
"grad_norm": 1.5703125,
"learning_rate": 9.569100000000001e-06,
"loss": 0.0028,
"num_tokens": 463757666.0,
"reward": 1.0566211104393006,
"reward_std": 0.18374029621481897,
"rewards/reward_accuracy/mean": 0.95703125,
"rewards/reward_accuracy/std": 0.1819690689444542,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.004616237222217023,
"sampling/importance_sampling_ratio/max": 2.667706644535065,
"sampling/importance_sampling_ratio/mean": 0.9932306408882141,
"sampling/importance_sampling_ratio/min": 0.13551494404673575,
"sampling/sampling_logp_difference/max": 0.871059513092041,
"sampling/sampling_logp_difference/mean": 0.004776544030755758,
"step": 4310,
"step_time": 7.663702180306427
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1544.1,
"completions/max_terminated_length": 1385.2,
"completions/mean_length": 186.439453125,
"completions/mean_terminated_length": 174.78260650634766,
"completions/min_length": 61.9,
"completions/min_terminated_length": 61.9,
"entropy": 0.0649915898218751,
"epoch": 9.250535331905782,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.625,
"learning_rate": 9.5681e-06,
"loss": -0.0039,
"num_tokens": 464750951.0,
"reward": 1.039609396457672,
"reward_std": 0.22247500121593475,
"rewards/reward_accuracy/mean": 0.940234375,
"rewards/reward_accuracy/std": 0.22011818885803222,
"rewards/reward_format/mean": 0.09937500208616257,
"rewards/reward_format/std": 0.005099985655397177,
"sampling/importance_sampling_ratio/max": 2.520794463157654,
"sampling/importance_sampling_ratio/mean": 0.9812482059001922,
"sampling/importance_sampling_ratio/min": 0.03798263035714626,
"sampling/sampling_logp_difference/max": 0.8889323353767395,
"sampling/sampling_logp_difference/mean": 0.0046604825649410484,
"step": 4320,
"step_time": 7.5691167728014985
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015234375,
"completions/max_length": 1726.1,
"completions/max_terminated_length": 1539.9,
"completions/mean_length": 206.80078125,
"completions/mean_terminated_length": 178.7330810546875,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.06688033207319677,
"epoch": 9.271948608137045,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.78515625,
"learning_rate": 9.5671e-06,
"loss": -0.002,
"num_tokens": 465795513.0,
"reward": 1.020312523841858,
"reward_std": 0.2626108840107918,
"rewards/reward_accuracy/mean": 0.921875,
"rewards/reward_accuracy/std": 0.2578453578054905,
"rewards/reward_format/mean": 0.09843750149011612,
"rewards/reward_format/std": 0.00852061677724123,
"sampling/importance_sampling_ratio/max": 2.5560715079307554,
"sampling/importance_sampling_ratio/mean": 0.9683886945247651,
"sampling/importance_sampling_ratio/min": 0.07049601599574089,
"sampling/sampling_logp_difference/max": 0.9678425669670105,
"sampling/sampling_logp_difference/mean": 0.004722708882763982,
"step": 4330,
"step_time": 8.684549869698822
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1349.8,
"completions/mean_length": 192.255078125,
"completions/mean_terminated_length": 177.66022033691405,
"completions/min_length": 62.4,
"completions/min_terminated_length": 62.4,
"entropy": 0.06652838652953505,
"epoch": 9.29336188436831,
"frac_reward_zero_std": 0.8125,
"grad_norm": 1.7265625,
"learning_rate": 9.5661e-06,
"loss": -0.0044,
"num_tokens": 466803158.0,
"reward": 1.0109375238418579,
"reward_std": 0.26207209601998327,
"rewards/reward_accuracy/mean": 0.91171875,
"rewards/reward_accuracy/std": 0.25973157212138176,
"rewards/reward_format/mean": 0.09921875074505807,
"rewards/reward_format/std": 0.007130344398319721,
"sampling/importance_sampling_ratio/max": 2.4281032562255858,
"sampling/importance_sampling_ratio/mean": 0.9797600686550141,
"sampling/importance_sampling_ratio/min": 0.09487551897764206,
"sampling/sampling_logp_difference/max": 1.0455473840236664,
"sampling/sampling_logp_difference/mean": 0.004806653340347111,
"step": 4340,
"step_time": 9.72000040000712
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1725.0,
"completions/max_terminated_length": 1556.8,
"completions/mean_length": 174.0109375,
"completions/mean_terminated_length": 160.91539001464844,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.05903993044048548,
"epoch": 9.314775160599572,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.5859375,
"learning_rate": 9.565100000000001e-06,
"loss": -0.0116,
"num_tokens": 467771842.0,
"reward": 1.032031273841858,
"reward_std": 0.22780647426843642,
"rewards/reward_accuracy/mean": 0.9328125,
"rewards/reward_accuracy/std": 0.22554035484790802,
"rewards/reward_format/mean": 0.09921875,
"rewards/reward_format/std": 0.006534937978722155,
"sampling/importance_sampling_ratio/max": 2.5860852718353273,
"sampling/importance_sampling_ratio/mean": 0.9985010504722596,
"sampling/importance_sampling_ratio/min": 0.0742593110539019,
"sampling/sampling_logp_difference/max": 0.8558264315128327,
"sampling/sampling_logp_difference/mean": 0.0044866729294881225,
"step": 4350,
"step_time": 8.237614817699068
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1577.1,
"completions/max_terminated_length": 1463.5,
"completions/mean_length": 182.22109375,
"completions/mean_terminated_length": 169.13054809570312,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.0672688112128526,
"epoch": 9.336188436830835,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.859375,
"learning_rate": 9.5641e-06,
"loss": 0.0027,
"num_tokens": 468757912.0,
"reward": 1.0479687452316284,
"reward_std": 0.21162447333335876,
"rewards/reward_accuracy/mean": 0.948828125,
"rewards/reward_accuracy/std": 0.20880995765328408,
"rewards/reward_format/mean": 0.09914062470197678,
"rewards/reward_format/std": 0.005950991157442331,
"sampling/importance_sampling_ratio/max": 2.5589951992034914,
"sampling/importance_sampling_ratio/mean": 0.9948416829109192,
"sampling/importance_sampling_ratio/min": 0.12206325381994247,
"sampling/sampling_logp_difference/max": 0.9030602455139161,
"sampling/sampling_logp_difference/mean": 0.0049245086498558525,
"step": 4360,
"step_time": 7.8668963635980615
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01484375,
"completions/max_length": 1706.0,
"completions/max_terminated_length": 1347.1,
"completions/mean_length": 199.35703125,
"completions/mean_terminated_length": 171.83860778808594,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"entropy": 0.0716796092223376,
"epoch": 9.357601713062099,
"frac_reward_zero_std": 0.78125,
"grad_norm": 0.0,
"learning_rate": 9.5631e-06,
"loss": -0.0102,
"num_tokens": 469776442.0,
"reward": 1.016699230670929,
"reward_std": 0.24354493767023086,
"rewards/reward_accuracy/mean": 0.91796875,
"rewards/reward_accuracy/std": 0.2396906465291977,
"rewards/reward_format/mean": 0.09873046949505807,
"rewards/reward_format/std": 0.00900216018781066,
"sampling/importance_sampling_ratio/max": 2.478578042984009,
"sampling/importance_sampling_ratio/mean": 0.9921741962432862,
"sampling/importance_sampling_ratio/min": 0.11129120327532291,
"sampling/sampling_logp_difference/max": 0.7442629218101502,
"sampling/sampling_logp_difference/mean": 0.004942310182377696,
"step": 4370,
"step_time": 8.541805119498168
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1824.9,
"completions/max_terminated_length": 1600.5,
"completions/mean_length": 184.46953125,
"completions/mean_terminated_length": 173.53758544921874,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.06576711686793715,
"epoch": 9.379014989293362,
"frac_reward_zero_std": 0.80625,
"grad_norm": 0.357421875,
"learning_rate": 9.562100000000001e-06,
"loss": 0.0027,
"num_tokens": 470765756.0,
"reward": 1.0172851800918579,
"reward_std": 0.24542029649019242,
"rewards/reward_accuracy/mean": 0.91796875,
"rewards/reward_accuracy/std": 0.2435908667743206,
"rewards/reward_format/mean": 0.09931640848517417,
"rewards/reward_format/std": 0.005417245859280229,
"sampling/importance_sampling_ratio/max": 2.543210816383362,
"sampling/importance_sampling_ratio/mean": 0.9856241583824158,
"sampling/importance_sampling_ratio/min": 0.05767898559570313,
"sampling/sampling_logp_difference/max": 0.7985962152481079,
"sampling/sampling_logp_difference/mean": 0.0047040089499205354,
"step": 4380,
"step_time": 8.731325372104767
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1636.6,
"completions/max_terminated_length": 1486.1,
"completions/mean_length": 202.72265625,
"completions/mean_terminated_length": 179.35181274414063,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.07099624550901354,
"epoch": 9.400428265524626,
"frac_reward_zero_std": 0.80625,
"grad_norm": 0.5,
"learning_rate": 9.5611e-06,
"loss": -0.0116,
"num_tokens": 471805718.0,
"reward": 1.0393554806709289,
"reward_std": 0.21470517441630363,
"rewards/reward_accuracy/mean": 0.940625,
"rewards/reward_accuracy/std": 0.21067939400672914,
"rewards/reward_format/mean": 0.09873047024011612,
"rewards/reward_format/std": 0.007009822688996792,
"sampling/importance_sampling_ratio/max": 2.5783260345458983,
"sampling/importance_sampling_ratio/mean": 0.9870540916919708,
"sampling/importance_sampling_ratio/min": 0.08108970501925797,
"sampling/sampling_logp_difference/max": 0.8799246668815612,
"sampling/sampling_logp_difference/mean": 0.004771760036237538,
"step": 4390,
"step_time": 8.233026880506078
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1599.7,
"completions/max_terminated_length": 1414.1,
"completions/mean_length": 175.53203125,
"completions/mean_terminated_length": 163.15062866210937,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.06446836795657873,
"epoch": 9.421841541755889,
"frac_reward_zero_std": 0.83125,
"grad_norm": 0.38671875,
"learning_rate": 9.560100000000002e-06,
"loss": -0.0081,
"num_tokens": 472772040.0,
"reward": 1.053769552707672,
"reward_std": 0.19931133836507797,
"rewards/reward_accuracy/mean": 0.954296875,
"rewards/reward_accuracy/std": 0.19738897532224656,
"rewards/reward_format/mean": 0.09947265684604645,
"rewards/reward_format/std": 0.004134091641753912,
"sampling/importance_sampling_ratio/max": 2.4874395370483398,
"sampling/importance_sampling_ratio/mean": 0.982071453332901,
"sampling/importance_sampling_ratio/min": 0.04745384864509106,
"sampling/sampling_logp_difference/max": 1.2734108746051789,
"sampling/sampling_logp_difference/mean": 0.004855910525657236,
"step": 4400,
"step_time": 7.643441689797328
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1650.4,
"completions/max_terminated_length": 1481.8,
"completions/mean_length": 175.55234375,
"completions/mean_terminated_length": 166.78504333496093,
"completions/min_length": 62.7,
"completions/min_terminated_length": 62.7,
"entropy": 0.06128122473601252,
"epoch": 9.443254817987151,
"frac_reward_zero_std": 0.84375,
"grad_norm": 0.049072265625,
"learning_rate": 9.559100000000001e-06,
"loss": 0.0017,
"num_tokens": 473735246.0,
"reward": 1.057324230670929,
"reward_std": 0.16801278546918183,
"rewards/reward_accuracy/mean": 0.9578125,
"rewards/reward_accuracy/std": 0.16543366611003876,
"rewards/reward_format/mean": 0.09951171875,
"rewards/reward_format/std": 0.004723456338979304,
"sampling/importance_sampling_ratio/max": 2.4580600023269654,
"sampling/importance_sampling_ratio/mean": 0.9903775513172149,
"sampling/importance_sampling_ratio/min": 0.1721593517344445,
"sampling/sampling_logp_difference/max": 0.79919353723526,
"sampling/sampling_logp_difference/mean": 0.004441940411925316,
"step": 4410,
"step_time": 7.8702811216935515
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 1755.2,
"completions/max_terminated_length": 1562.6,
"completions/mean_length": 189.63984375,
"completions/mean_terminated_length": 167.79573516845704,
"completions/min_length": 68.7,
"completions/min_terminated_length": 68.7,
"entropy": 0.0686734376475215,
"epoch": 9.464668094218416,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.734375,
"learning_rate": 9.558100000000001e-06,
"loss": -0.009,
"num_tokens": 474733732.0,
"reward": 1.019648450613022,
"reward_std": 0.24684321880340576,
"rewards/reward_accuracy/mean": 0.920703125,
"rewards/reward_accuracy/std": 0.24349657222628593,
"rewards/reward_format/mean": 0.09894531369209289,
"rewards/reward_format/std": 0.007075710245408118,
"sampling/importance_sampling_ratio/max": 2.2642454147338866,
"sampling/importance_sampling_ratio/mean": 0.9932459235191345,
"sampling/importance_sampling_ratio/min": 0.044277400430291894,
"sampling/sampling_logp_difference/max": 0.8217674911022186,
"sampling/sampling_logp_difference/mean": 0.004675857443362475,
"step": 4420,
"step_time": 8.8776290750131
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1578.4,
"completions/max_terminated_length": 1367.5,
"completions/mean_length": 162.68515625,
"completions/mean_terminated_length": 157.54578552246093,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.06268081087619067,
"epoch": 9.486081370449678,
"frac_reward_zero_std": 0.83125,
"grad_norm": 0.0,
"learning_rate": 9.5571e-06,
"loss": -0.0181,
"num_tokens": 475673294.0,
"reward": 1.0504883050918579,
"reward_std": 0.1760025516152382,
"rewards/reward_accuracy/mean": 0.95078125,
"rewards/reward_accuracy/std": 0.174680595099926,
"rewards/reward_format/mean": 0.09970703274011612,
"rewards/reward_format/std": 0.0029735487652942537,
"sampling/importance_sampling_ratio/max": 2.380132484436035,
"sampling/importance_sampling_ratio/mean": 0.9896663188934326,
"sampling/importance_sampling_ratio/min": 0.034796826727688315,
"sampling/sampling_logp_difference/max": 0.8769776701927186,
"sampling/sampling_logp_difference/mean": 0.004718778515234589,
"step": 4430,
"step_time": 7.492926518197055
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1672.9,
"completions/max_terminated_length": 1374.2,
"completions/mean_length": 181.27890625,
"completions/mean_terminated_length": 168.11006927490234,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.06455726455897093,
"epoch": 9.507494646680943,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.365234375,
"learning_rate": 9.5561e-06,
"loss": -0.0157,
"num_tokens": 476657496.0,
"reward": 1.0605273604393006,
"reward_std": 0.16927805319428443,
"rewards/reward_accuracy/mean": 0.961328125,
"rewards/reward_accuracy/std": 0.1658659353852272,
"rewards/reward_format/mean": 0.09919921904802323,
"rewards/reward_format/std": 0.0065894994186237454,
"sampling/importance_sampling_ratio/max": 2.3545122504234315,
"sampling/importance_sampling_ratio/mean": 0.9779762148857116,
"sampling/importance_sampling_ratio/min": 0.05696086809039116,
"sampling/sampling_logp_difference/max": 0.9655421733856201,
"sampling/sampling_logp_difference/mean": 0.004566542524844408,
"step": 4440,
"step_time": 8.079634706521755
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1605.7,
"completions/max_terminated_length": 1451.6,
"completions/mean_length": 184.709375,
"completions/mean_terminated_length": 169.61580810546874,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"entropy": 0.07341660978272557,
"epoch": 9.528907922912206,
"frac_reward_zero_std": 0.8125,
"grad_norm": 0.0,
"learning_rate": 9.555100000000001e-06,
"loss": -0.0101,
"num_tokens": 477645840.0,
"reward": 1.0446679890155792,
"reward_std": 0.2037160314619541,
"rewards/reward_accuracy/mean": 0.9453125,
"rewards/reward_accuracy/std": 0.20144574120640754,
"rewards/reward_format/mean": 0.09935546964406967,
"rewards/reward_format/std": 0.005727204866707325,
"sampling/importance_sampling_ratio/max": 2.394430100917816,
"sampling/importance_sampling_ratio/mean": 0.9754915177822113,
"sampling/importance_sampling_ratio/min": 0.09303736705332995,
"sampling/sampling_logp_difference/max": 0.7740956366062164,
"sampling/sampling_logp_difference/mean": 0.005077766999602318,
"step": 4450,
"step_time": 7.871897396381246
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.6889900052774464e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.6889900052774464e-06,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1758.0,
"completions/max_terminated_length": 1594.2,
"completions/mean_length": 207.796875,
"completions/mean_terminated_length": 184.83839721679686,
"completions/min_length": 68.1,
"completions/min_terminated_length": 68.1,
"entropy": 0.0676295671146363,
"epoch": 9.550321199143468,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.328125,
"learning_rate": 9.5541e-06,
"loss": -0.009,
"num_tokens": 478694600.0,
"reward": 1.042167991399765,
"reward_std": 0.2066587306559086,
"rewards/reward_accuracy/mean": 0.943359375,
"rewards/reward_accuracy/std": 0.20336295515298844,
"rewards/reward_format/mean": 0.09880859553813934,
"rewards/reward_format/std": 0.0065515269059687855,
"sampling/importance_sampling_ratio/max": 2.561271548271179,
"sampling/importance_sampling_ratio/mean": 0.969097375869751,
"sampling/importance_sampling_ratio/min": 0.05691698044538498,
"sampling/sampling_logp_difference/max": 0.9503329515457153,
"sampling/sampling_logp_difference/mean": 0.004491203418001533,
"step": 4460,
"step_time": 8.599835031517433
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1580.6,
"completions/max_terminated_length": 1461.6,
"completions/mean_length": 169.99921875,
"completions/mean_terminated_length": 161.24249572753905,
"completions/min_length": 68.1,
"completions/min_terminated_length": 68.1,
"entropy": 0.06418886468745769,
"epoch": 9.571734475374733,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.625,
"learning_rate": 9.5531e-06,
"loss": -0.0054,
"num_tokens": 479649542.0,
"reward": 1.0370703339576721,
"reward_std": 0.21632306426763534,
"rewards/reward_accuracy/mean": 0.9375,
"rewards/reward_accuracy/std": 0.21453142166137695,
"rewards/reward_format/mean": 0.09957031384110451,
"rewards/reward_format/std": 0.004507384612224996,
"sampling/importance_sampling_ratio/max": 2.4228013515472413,
"sampling/importance_sampling_ratio/mean": 0.9802545011043549,
"sampling/importance_sampling_ratio/min": 0.13631801009178163,
"sampling/sampling_logp_difference/max": 0.8852425873279571,
"sampling/sampling_logp_difference/mean": 0.004775017919018865,
"step": 4470,
"step_time": 7.457075692483341
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01328125,
"completions/max_length": 1642.5,
"completions/max_terminated_length": 1485.6,
"completions/mean_length": 205.515625,
"completions/mean_terminated_length": 180.86492309570312,
"completions/min_length": 69.8,
"completions/min_terminated_length": 69.8,
"entropy": 0.0745356248691678,
"epoch": 9.593147751605995,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.73046875,
"learning_rate": 9.552100000000001e-06,
"loss": -0.0128,
"num_tokens": 480700478.0,
"reward": 1.022050815820694,
"reward_std": 0.26660343557596206,
"rewards/reward_accuracy/mean": 0.923046875,
"rewards/reward_accuracy/std": 0.26320427358150483,
"rewards/reward_format/mean": 0.09900390654802323,
"rewards/reward_format/std": 0.006793073401786387,
"sampling/importance_sampling_ratio/max": 2.384682261943817,
"sampling/importance_sampling_ratio/mean": 0.9727111339569092,
"sampling/importance_sampling_ratio/min": 0.09923578351736069,
"sampling/sampling_logp_difference/max": 0.7957505941390991,
"sampling/sampling_logp_difference/mean": 0.004994449764490127,
"step": 4480,
"step_time": 8.117693231601152
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1366.4,
"completions/max_terminated_length": 1231.3,
"completions/mean_length": 170.166015625,
"completions/mean_terminated_length": 165.81835021972657,
"completions/min_length": 62.2,
"completions/min_terminated_length": 62.2,
"entropy": 0.05542967626824975,
"epoch": 9.61456102783726,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.58984375,
"learning_rate": 9.5511e-06,
"loss": -0.0044,
"num_tokens": 481643591.0,
"reward": 1.0504687666893004,
"reward_std": 0.18444409295916558,
"rewards/reward_accuracy/mean": 0.95078125,
"rewards/reward_accuracy/std": 0.18356447890400887,
"rewards/reward_format/mean": 0.09968750104308129,
"rewards/reward_format/std": 0.0038199495291337373,
"sampling/importance_sampling_ratio/max": 2.443958878517151,
"sampling/importance_sampling_ratio/mean": 0.9813065469264984,
"sampling/importance_sampling_ratio/min": 0.13236462250351905,
"sampling/sampling_logp_difference/max": 0.862000024318695,
"sampling/sampling_logp_difference/mean": 0.004212787770666182,
"step": 4490,
"step_time": 6.738587602195912
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1308.4,
"completions/max_terminated_length": 1224.7,
"completions/mean_length": 174.981640625,
"completions/mean_terminated_length": 164.3553039550781,
"completions/min_length": 61.1,
"completions/min_terminated_length": 61.1,
"entropy": 0.05995004908181727,
"epoch": 9.635974304068522,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.24609375,
"learning_rate": 9.5501e-06,
"loss": -0.0098,
"num_tokens": 482607336.0,
"reward": 1.0544531285762786,
"reward_std": 0.185345159471035,
"rewards/reward_accuracy/mean": 0.955078125,
"rewards/reward_accuracy/std": 0.18369442820549012,
"rewards/reward_format/mean": 0.09937499910593033,
"rewards/reward_format/std": 0.003909741784445942,
"sampling/importance_sampling_ratio/max": 2.390349006652832,
"sampling/importance_sampling_ratio/mean": 0.990923672914505,
"sampling/importance_sampling_ratio/min": 0.08934946656227112,
"sampling/sampling_logp_difference/max": 0.8589655339717865,
"sampling/sampling_logp_difference/mean": 0.004498122539371252,
"step": 4500,
"step_time": 6.472322314011398
},
{
"clip_ratio/high_max": 2.57127067015972e-05,
"clip_ratio/high_mean": 3.21408833769965e-06,
"clip_ratio/low_mean": 3.4622019029484363e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 6.676290217910718e-06,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 1612.9,
"completions/max_terminated_length": 1245.8,
"completions/mean_length": 184.523828125,
"completions/mean_terminated_length": 162.2779983520508,
"completions/min_length": 63.2,
"completions/min_terminated_length": 63.2,
"entropy": 0.061006424762308595,
"epoch": 9.657387580299785,
"frac_reward_zero_std": 0.80625,
"grad_norm": 0.88671875,
"learning_rate": 9.549100000000001e-06,
"loss": -0.0041,
"num_tokens": 483600853.0,
"reward": 1.035996103286743,
"reward_std": 0.2211511179804802,
"rewards/reward_accuracy/mean": 0.937109375,
"rewards/reward_accuracy/std": 0.2171064794063568,
"rewards/reward_format/mean": 0.09888671934604645,
"rewards/reward_format/std": 0.006889175507239997,
"sampling/importance_sampling_ratio/max": 2.4588751673698424,
"sampling/importance_sampling_ratio/mean": 0.9891256749629974,
"sampling/importance_sampling_ratio/min": 0.11688677249476313,
"sampling/sampling_logp_difference/max": 0.9345655798912048,
"sampling/sampling_logp_difference/mean": 0.00438638364430517,
"step": 4510,
"step_time": 7.93719335879432
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1485.6,
"completions/max_terminated_length": 1107.4,
"completions/mean_length": 166.38828125,
"completions/mean_terminated_length": 159.94239654541016,
"completions/min_length": 69.6,
"completions/min_terminated_length": 69.6,
"entropy": 0.05691851954907179,
"epoch": 9.67880085653105,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.154296875,
"learning_rate": 9.548100000000001e-06,
"loss": -0.0019,
"num_tokens": 484543847.0,
"reward": 1.0531640946865082,
"reward_std": 0.16968794986605645,
"rewards/reward_accuracy/mean": 0.953515625,
"rewards/reward_accuracy/std": 0.16814736574888228,
"rewards/reward_format/mean": 0.09964843988418579,
"rewards/reward_format/std": 0.0032007530331611632,
"sampling/importance_sampling_ratio/max": 2.4984234809875487,
"sampling/importance_sampling_ratio/mean": 0.9907629787921906,
"sampling/importance_sampling_ratio/min": 0.08774418979883195,
"sampling/sampling_logp_difference/max": 0.9244373977184296,
"sampling/sampling_logp_difference/mean": 0.004406162491068244,
"step": 4520,
"step_time": 7.131714124820428
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.3182873317418853e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.3182873317418853e-06,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1326.0,
"completions/max_terminated_length": 1137.3,
"completions/mean_length": 164.93515625,
"completions/mean_terminated_length": 151.83497924804686,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.05531797371804714,
"epoch": 9.700214132762312,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.4921875,
"learning_rate": 9.5471e-06,
"loss": -0.0068,
"num_tokens": 485480305.0,
"reward": 1.0520898580551148,
"reward_std": 0.18664565831422805,
"rewards/reward_accuracy/mean": 0.952734375,
"rewards/reward_accuracy/std": 0.1842656247317791,
"rewards/reward_format/mean": 0.09935546964406967,
"rewards/reward_format/std": 0.005046476423740387,
"sampling/importance_sampling_ratio/max": 2.286334490776062,
"sampling/importance_sampling_ratio/mean": 0.9868440508842469,
"sampling/importance_sampling_ratio/min": 0.14201218262314796,
"sampling/sampling_logp_difference/max": 0.8547847032546997,
"sampling/sampling_logp_difference/mean": 0.004271036735735834,
"step": 4530,
"step_time": 6.441755916189868
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1783.4,
"completions/max_terminated_length": 1627.7,
"completions/mean_length": 195.555078125,
"completions/mean_terminated_length": 172.6228515625,
"completions/min_length": 64.7,
"completions/min_terminated_length": 64.7,
"entropy": 0.07116033071652055,
"epoch": 9.721627408993577,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.73046875,
"learning_rate": 9.5461e-06,
"loss": -0.0093,
"num_tokens": 486502238.0,
"reward": 1.0175976753234863,
"reward_std": 0.2378186911344528,
"rewards/reward_accuracy/mean": 0.918359375,
"rewards/reward_accuracy/std": 0.2357243061065674,
"rewards/reward_format/mean": 0.0992382824420929,
"rewards/reward_format/std": 0.005488302651792764,
"sampling/importance_sampling_ratio/max": 2.608646535873413,
"sampling/importance_sampling_ratio/mean": 0.9679303169250488,
"sampling/importance_sampling_ratio/min": 0.0,
"sampling/sampling_logp_difference/max": 0.9133510589599609,
"sampling/sampling_logp_difference/mean": 0.004949691891670227,
"step": 4540,
"step_time": 8.697833370711304
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1716.4,
"completions/max_terminated_length": 1590.7,
"completions/mean_length": 186.908984375,
"completions/mean_terminated_length": 176.9185012817383,
"completions/min_length": 61.9,
"completions/min_terminated_length": 61.9,
"entropy": 0.06773204165510834,
"epoch": 9.74304068522484,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.73046875,
"learning_rate": 9.545100000000001e-06,
"loss": -0.0106,
"num_tokens": 487498037.0,
"reward": 1.032695323228836,
"reward_std": 0.23750925436615944,
"rewards/reward_accuracy/mean": 0.933203125,
"rewards/reward_accuracy/std": 0.235887710750103,
"rewards/reward_format/mean": 0.09949218854308128,
"rewards/reward_format/std": 0.005055475584231317,
"sampling/importance_sampling_ratio/max": 2.49283572435379,
"sampling/importance_sampling_ratio/mean": 0.986643624305725,
"sampling/importance_sampling_ratio/min": 0.10966926738619805,
"sampling/sampling_logp_difference/max": 0.9840800344944001,
"sampling/sampling_logp_difference/mean": 0.005033767921850086,
"step": 4550,
"step_time": 8.2680405380117
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1764.6,
"completions/max_terminated_length": 1593.5,
"completions/mean_length": 171.569921875,
"completions/mean_terminated_length": 158.52721710205077,
"completions/min_length": 56.1,
"completions/min_terminated_length": 56.1,
"entropy": 0.059660279145464304,
"epoch": 9.764453961456102,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.443359375,
"learning_rate": 9.5441e-06,
"loss": 0.0039,
"num_tokens": 488453080.0,
"reward": 1.037695336341858,
"reward_std": 0.2224169120192528,
"rewards/reward_accuracy/mean": 0.93828125,
"rewards/reward_accuracy/std": 0.2205433279275894,
"rewards/reward_format/mean": 0.09941406399011612,
"rewards/reward_format/std": 0.005348098673857748,
"sampling/importance_sampling_ratio/max": 2.4715290546417235,
"sampling/importance_sampling_ratio/mean": 0.9906910359859467,
"sampling/importance_sampling_ratio/min": 0.07961583929136395,
"sampling/sampling_logp_difference/max": 0.7815635442733765,
"sampling/sampling_logp_difference/mean": 0.004459577472880482,
"step": 4560,
"step_time": 8.505619942804334
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.0822124017504393e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.0822124017504393e-06,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1706.3,
"completions/max_terminated_length": 1603.8,
"completions/mean_length": 180.62109375,
"completions/mean_terminated_length": 161.53917846679687,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.06901807188987732,
"epoch": 9.785867237687366,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.703125,
"learning_rate": 9.5431e-06,
"loss": -0.0103,
"num_tokens": 489433150.0,
"reward": 1.0238086104393005,
"reward_std": 0.25063580423593523,
"rewards/reward_accuracy/mean": 0.924609375,
"rewards/reward_accuracy/std": 0.24830459356307982,
"rewards/reward_format/mean": 0.09919922053813934,
"rewards/reward_format/std": 0.005881550186313689,
"sampling/importance_sampling_ratio/max": 2.520624279975891,
"sampling/importance_sampling_ratio/mean": 0.9962082803249359,
"sampling/importance_sampling_ratio/min": 0.08497162032872438,
"sampling/sampling_logp_difference/max": 0.8319107532501221,
"sampling/sampling_logp_difference/mean": 0.004735717969015241,
"step": 4570,
"step_time": 8.392134373306181
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1501.8,
"completions/max_terminated_length": 1250.3,
"completions/mean_length": 162.976171875,
"completions/mean_terminated_length": 155.63510437011718,
"completions/min_length": 64.4,
"completions/min_terminated_length": 64.4,
"entropy": 0.05986858382821083,
"epoch": 9.807280513918629,
"frac_reward_zero_std": 0.83125,
"grad_norm": 0.53125,
"learning_rate": 9.542100000000001e-06,
"loss": -0.0068,
"num_tokens": 490368225.0,
"reward": 1.0597265779972076,
"reward_std": 0.18204839080572127,
"rewards/reward_accuracy/mean": 0.96015625,
"rewards/reward_accuracy/std": 0.17988041639328003,
"rewards/reward_format/mean": 0.09957031384110451,
"rewards/reward_format/std": 0.0038833118975162505,
"sampling/importance_sampling_ratio/max": 2.413654100894928,
"sampling/importance_sampling_ratio/mean": 0.9925789594650268,
"sampling/importance_sampling_ratio/min": 0.13196225743740797,
"sampling/sampling_logp_difference/max": 0.796013230085373,
"sampling/sampling_logp_difference/mean": 0.004629714810289442,
"step": 4580,
"step_time": 7.159743593994063
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1647.4,
"completions/max_terminated_length": 1487.4,
"completions/mean_length": 178.601953125,
"completions/mean_terminated_length": 161.8654815673828,
"completions/min_length": 61.9,
"completions/min_terminated_length": 61.9,
"entropy": 0.06628262377344071,
"epoch": 9.828693790149893,
"frac_reward_zero_std": 0.78125,
"grad_norm": 0.73046875,
"learning_rate": 9.541100000000001e-06,
"loss": -0.0069,
"num_tokens": 491339926.0,
"reward": 1.0269922256469726,
"reward_std": 0.251862733066082,
"rewards/reward_accuracy/mean": 0.927734375,
"rewards/reward_accuracy/std": 0.24938036873936653,
"rewards/reward_format/mean": 0.09925781413912774,
"rewards/reward_format/std": 0.006323321955278516,
"sampling/importance_sampling_ratio/max": 2.486555314064026,
"sampling/importance_sampling_ratio/mean": 0.9726633787155151,
"sampling/importance_sampling_ratio/min": 0.108472665771842,
"sampling/sampling_logp_difference/max": 0.8040017247200012,
"sampling/sampling_logp_difference/mean": 0.004856206104159355,
"step": 4590,
"step_time": 8.088956012914423
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1891.3,
"completions/max_terminated_length": 1526.8,
"completions/mean_length": 178.721484375,
"completions/mean_terminated_length": 161.84876403808593,
"completions/min_length": 61.3,
"completions/min_terminated_length": 61.3,
"entropy": 0.06509755046572537,
"epoch": 9.850107066381156,
"frac_reward_zero_std": 0.81875,
"grad_norm": 1.265625,
"learning_rate": 9.5401e-06,
"loss": -0.0037,
"num_tokens": 492318653.0,
"reward": 1.0129297018051147,
"reward_std": 0.27349558025598525,
"rewards/reward_accuracy/mean": 0.913671875,
"rewards/reward_accuracy/std": 0.27083732932806015,
"rewards/reward_format/mean": 0.09925781339406967,
"rewards/reward_format/std": 0.006845196196809411,
"sampling/importance_sampling_ratio/max": 2.406098258495331,
"sampling/importance_sampling_ratio/mean": 0.9857916593551636,
"sampling/importance_sampling_ratio/min": 0.03242781683802605,
"sampling/sampling_logp_difference/max": 0.8238243341445923,
"sampling/sampling_logp_difference/mean": 0.004675760865211487,
"step": 4600,
"step_time": 9.205698450299678
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.011328125,
"completions/max_length": 1710.6,
"completions/max_terminated_length": 1409.2,
"completions/mean_length": 182.049609375,
"completions/mean_terminated_length": 160.84967041015625,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.060299227200448516,
"epoch": 9.87152034261242,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.62109375,
"learning_rate": 9.539100000000002e-06,
"loss": -0.0055,
"num_tokens": 493307772.0,
"reward": 1.0219335973262786,
"reward_std": 0.24752654507756233,
"rewards/reward_accuracy/mean": 0.923046875,
"rewards/reward_accuracy/std": 0.24337337017059327,
"rewards/reward_format/mean": 0.09888671785593033,
"rewards/reward_format/std": 0.007974892528727651,
"sampling/importance_sampling_ratio/max": 2.4677175164222716,
"sampling/importance_sampling_ratio/mean": 0.9788722157478332,
"sampling/importance_sampling_ratio/min": 0.09889643359929323,
"sampling/sampling_logp_difference/max": 1.092416000366211,
"sampling/sampling_logp_difference/mean": 0.004543773178011179,
"step": 4610,
"step_time": 8.099804440591834
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1437.5,
"completions/max_terminated_length": 1222.1,
"completions/mean_length": 150.1828125,
"completions/mean_terminated_length": 140.53572845458984,
"completions/min_length": 61.9,
"completions/min_terminated_length": 61.9,
"entropy": 0.05626896710600704,
"epoch": 9.892933618843683,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.2060546875,
"learning_rate": 9.538100000000001e-06,
"loss": -0.0035,
"num_tokens": 494212000.0,
"reward": 1.0249023675918578,
"reward_std": 0.2509645760059357,
"rewards/reward_accuracy/mean": 0.925390625,
"rewards/reward_accuracy/std": 0.24944152757525445,
"rewards/reward_format/mean": 0.09951171949505806,
"rewards/reward_format/std": 0.004428820172324777,
"sampling/importance_sampling_ratio/max": 2.5628363490104675,
"sampling/importance_sampling_ratio/mean": 0.9854185879230499,
"sampling/importance_sampling_ratio/min": 0.1182455386966467,
"sampling/sampling_logp_difference/max": 0.8058889091014863,
"sampling/sampling_logp_difference/mean": 0.004434937797486782,
"step": 4620,
"step_time": 6.957148669296293
},
{
"clip_ratio/high_max": 1.2590027836267836e-05,
"clip_ratio/high_mean": 1.5737534795334795e-06,
"clip_ratio/low_mean": 8.205546782846795e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 9.779300353329744e-06,
"completions/clipped_ratio": 0.013671875,
"completions/max_length": 1767.5,
"completions/max_terminated_length": 1560.8,
"completions/mean_length": 192.45390625,
"completions/mean_terminated_length": 166.8750244140625,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.06687218085862696,
"epoch": 9.914346895074946,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.1884765625,
"learning_rate": 9.5371e-06,
"loss": -0.0056,
"num_tokens": 495226058.0,
"reward": 1.0253125250339508,
"reward_std": 0.25344937294721603,
"rewards/reward_accuracy/mean": 0.9265625,
"rewards/reward_accuracy/std": 0.24933107569813728,
"rewards/reward_format/mean": 0.09875000193715096,
"rewards/reward_format/std": 0.0070200205314904455,
"sampling/importance_sampling_ratio/max": 2.5021052837371824,
"sampling/importance_sampling_ratio/mean": 0.9817708969116211,
"sampling/importance_sampling_ratio/min": 0.07996816746890545,
"sampling/sampling_logp_difference/max": 0.9307345509529114,
"sampling/sampling_logp_difference/mean": 0.004679089644923806,
"step": 4630,
"step_time": 8.6813833822147
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1780.0,
"completions/max_terminated_length": 1647.4,
"completions/mean_length": 201.84296875,
"completions/mean_terminated_length": 183.96093139648437,
"completions/min_length": 67.2,
"completions/min_terminated_length": 67.2,
"entropy": 0.06814839667640626,
"epoch": 9.93576017130621,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.171875,
"learning_rate": 9.5361e-06,
"loss": -0.007,
"num_tokens": 496261912.0,
"reward": 1.0204687774181367,
"reward_std": 0.24497573524713517,
"rewards/reward_accuracy/mean": 0.921484375,
"rewards/reward_accuracy/std": 0.24184768348932267,
"rewards/reward_format/mean": 0.0989843763411045,
"rewards/reward_format/std": 0.007863890496082604,
"sampling/importance_sampling_ratio/max": 2.4455806493759153,
"sampling/importance_sampling_ratio/mean": 0.9807735204696655,
"sampling/importance_sampling_ratio/min": 0.09633135758340358,
"sampling/sampling_logp_difference/max": 1.082131028175354,
"sampling/sampling_logp_difference/mean": 0.004603962879627943,
"step": 4640,
"step_time": 8.878456921389443
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1529.0,
"completions/max_terminated_length": 1106.4,
"completions/mean_length": 159.657421875,
"completions/mean_terminated_length": 150.8436752319336,
"completions/min_length": 64.7,
"completions/min_terminated_length": 64.7,
"entropy": 0.0569696560036391,
"epoch": 9.957173447537473,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.80078125,
"learning_rate": 9.535100000000001e-06,
"loss": -0.0084,
"num_tokens": 497187803.0,
"reward": 1.0296094000339509,
"reward_std": 0.2422708563506603,
"rewards/reward_accuracy/mean": 0.930078125,
"rewards/reward_accuracy/std": 0.24068141728639603,
"rewards/reward_format/mean": 0.0995312511920929,
"rewards/reward_format/std": 0.004436398460529745,
"sampling/importance_sampling_ratio/max": 2.3403586387634276,
"sampling/importance_sampling_ratio/mean": 0.9843671917915344,
"sampling/importance_sampling_ratio/min": 0.060144102200865746,
"sampling/sampling_logp_difference/max": 1.0288600683212281,
"sampling/sampling_logp_difference/mean": 0.004498667968437076,
"step": 4650,
"step_time": 7.245305071392795
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1672.5,
"completions/max_terminated_length": 1336.7,
"completions/mean_length": 184.137109375,
"completions/mean_terminated_length": 168.96661376953125,
"completions/min_length": 61.8,
"completions/min_terminated_length": 61.8,
"entropy": 0.06492012199014426,
"epoch": 9.978586723768737,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.58203125,
"learning_rate": 9.5341e-06,
"loss": -0.0066,
"num_tokens": 498180906.0,
"reward": 1.0069726705551147,
"reward_std": 0.26464433670043946,
"rewards/reward_accuracy/mean": 0.9078125,
"rewards/reward_accuracy/std": 0.2624760016798973,
"rewards/reward_format/mean": 0.09916015565395356,
"rewards/reward_format/std": 0.00609325550030917,
"sampling/importance_sampling_ratio/max": 2.4993377685546876,
"sampling/importance_sampling_ratio/mean": 0.9859911143779755,
"sampling/importance_sampling_ratio/min": 0.08112027458846569,
"sampling/sampling_logp_difference/max": 0.7634958267211914,
"sampling/sampling_logp_difference/mean": 0.004719214467331767,
"step": 4660,
"step_time": 8.155220012229984
},
{
"clip_ratio/high_max": 4.145838465774432e-05,
"clip_ratio/high_mean": 5.18229808221804e-06,
"clip_ratio/low_mean": 3.9637238842260557e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 5.578670470640645e-06,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1583.4,
"completions/max_terminated_length": 1338.9,
"completions/mean_length": 179.44921875,
"completions/mean_terminated_length": 162.9051513671875,
"completions/min_length": 67.5,
"completions/min_terminated_length": 67.5,
"entropy": 0.0680500041693449,
"epoch": 10.0,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.82421875,
"learning_rate": 9.5331e-06,
"loss": -0.0075,
"num_tokens": 499157032.0,
"reward": 1.0245703101158141,
"reward_std": 0.24218075945973397,
"rewards/reward_accuracy/mean": 0.925390625,
"rewards/reward_accuracy/std": 0.23948295712471007,
"rewards/reward_format/mean": 0.09917968660593032,
"rewards/reward_format/std": 0.006347464257851243,
"sampling/importance_sampling_ratio/max": 2.3952232360839845,
"sampling/importance_sampling_ratio/mean": 0.983648556470871,
"sampling/importance_sampling_ratio/min": 0.14207094460725783,
"sampling/sampling_logp_difference/max": 0.7520514488220215,
"sampling/sampling_logp_difference/mean": 0.004897421645000577,
"step": 4670,
"step_time": 7.882719579903641
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1700.4,
"completions/max_terminated_length": 1486.7,
"completions/mean_length": 183.508984375,
"completions/mean_terminated_length": 171.87130279541014,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.06401038118638099,
"epoch": 10.021413276231263,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.5703125,
"learning_rate": 9.532100000000001e-06,
"loss": -0.0134,
"num_tokens": 500143871.0,
"reward": 1.0349609851837158,
"reward_std": 0.23652325794100762,
"rewards/reward_accuracy/mean": 0.935546875,
"rewards/reward_accuracy/std": 0.23443732932209968,
"rewards/reward_format/mean": 0.09941406473517418,
"rewards/reward_format/std": 0.0058149552904069425,
"sampling/importance_sampling_ratio/max": 2.4824804306030273,
"sampling/importance_sampling_ratio/mean": 0.9793519079685211,
"sampling/importance_sampling_ratio/min": 0.007209146767854691,
"sampling/sampling_logp_difference/max": 0.8908413171768188,
"sampling/sampling_logp_difference/mean": 0.004679564922116697,
"step": 4680,
"step_time": 8.200568524489062
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.010546875,
"completions/max_length": 1583.8,
"completions/max_terminated_length": 1300.2,
"completions/mean_length": 176.614453125,
"completions/mean_terminated_length": 156.8802848815918,
"completions/min_length": 63.1,
"completions/min_terminated_length": 63.1,
"entropy": 0.06568360319361091,
"epoch": 10.042826552462527,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.349609375,
"learning_rate": 9.531100000000001e-06,
"loss": -0.0031,
"num_tokens": 501115124.0,
"reward": 1.013242208957672,
"reward_std": 0.23335094526410102,
"rewards/reward_accuracy/mean": 0.9140625,
"rewards/reward_accuracy/std": 0.2305763341486454,
"rewards/reward_format/mean": 0.0991796873509884,
"rewards/reward_format/std": 0.006242572469636798,
"sampling/importance_sampling_ratio/max": 2.5319902896881104,
"sampling/importance_sampling_ratio/mean": 0.9834266543388367,
"sampling/importance_sampling_ratio/min": 0.12470246888697148,
"sampling/sampling_logp_difference/max": 0.9546233654022217,
"sampling/sampling_logp_difference/mean": 0.004813213716261089,
"step": 4690,
"step_time": 7.702898796781665
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.9710767446667886e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.9710767446667886e-06,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1421.8,
"completions/max_terminated_length": 1235.9,
"completions/mean_length": 165.30625,
"completions/mean_terminated_length": 146.19444122314454,
"completions/min_length": 63.5,
"completions/min_terminated_length": 63.5,
"entropy": 0.04887988062109798,
"epoch": 10.06423982869379,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.37890625,
"learning_rate": 9.5301e-06,
"loss": -0.0104,
"num_tokens": 502053748.0,
"reward": 1.018632835149765,
"reward_std": 0.26105369329452516,
"rewards/reward_accuracy/mean": 0.91953125,
"rewards/reward_accuracy/std": 0.2581039220094681,
"rewards/reward_format/mean": 0.09910156354308128,
"rewards/reward_format/std": 0.005346291325986385,
"sampling/importance_sampling_ratio/max": 2.439615249633789,
"sampling/importance_sampling_ratio/mean": 0.9883929491043091,
"sampling/importance_sampling_ratio/min": 0.14723904244601727,
"sampling/sampling_logp_difference/max": 0.7908167600631714,
"sampling/sampling_logp_difference/mean": 0.004059883882291615,
"step": 4700,
"step_time": 7.214248881602543
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1549.3,
"completions/max_terminated_length": 1240.0,
"completions/mean_length": 159.0359375,
"completions/mean_terminated_length": 151.64660415649413,
"completions/min_length": 68.5,
"completions/min_terminated_length": 68.5,
"entropy": 0.05572506014723331,
"epoch": 10.085653104925054,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.302734375,
"learning_rate": 9.529100000000002e-06,
"loss": -0.0054,
"num_tokens": 502977856.0,
"reward": 1.042167991399765,
"reward_std": 0.20888747796416282,
"rewards/reward_accuracy/mean": 0.942578125,
"rewards/reward_accuracy/std": 0.2073250137269497,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.003935943846590817,
"sampling/importance_sampling_ratio/max": 2.3481542825698853,
"sampling/importance_sampling_ratio/mean": 0.9908926844596863,
"sampling/importance_sampling_ratio/min": 0.11660761777311564,
"sampling/sampling_logp_difference/max": 0.8368308186531067,
"sampling/sampling_logp_difference/mean": 0.004387181042693556,
"step": 4710,
"step_time": 7.495495401567314
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1407.4,
"completions/max_terminated_length": 1256.9,
"completions/mean_length": 159.316015625,
"completions/mean_terminated_length": 149.13192749023438,
"completions/min_length": 61.3,
"completions/min_terminated_length": 61.3,
"entropy": 0.05402598327491433,
"epoch": 10.107066381156317,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.341796875,
"learning_rate": 9.528100000000001e-06,
"loss": -0.0066,
"num_tokens": 503901097.0,
"reward": 1.0530273497104645,
"reward_std": 0.19916786551475524,
"rewards/reward_accuracy/mean": 0.953515625,
"rewards/reward_accuracy/std": 0.1973455399274826,
"rewards/reward_format/mean": 0.09951171875,
"rewards/reward_format/std": 0.004182660300284624,
"sampling/importance_sampling_ratio/max": 2.478246879577637,
"sampling/importance_sampling_ratio/mean": 0.9915070950984954,
"sampling/importance_sampling_ratio/min": 0.163948343321681,
"sampling/sampling_logp_difference/max": 0.8108892440795898,
"sampling/sampling_logp_difference/mean": 0.004345384589396417,
"step": 4720,
"step_time": 6.810153344005812
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1325.5,
"completions/max_terminated_length": 1062.4,
"completions/mean_length": 160.971875,
"completions/mean_terminated_length": 150.75925903320314,
"completions/min_length": 65.3,
"completions/min_terminated_length": 65.3,
"entropy": 0.055510355555452404,
"epoch": 10.12847965738758,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.3828125,
"learning_rate": 9.5271e-06,
"loss": -0.0018,
"num_tokens": 504829905.0,
"reward": 1.0277148842811585,
"reward_std": 0.2311268039047718,
"rewards/reward_accuracy/mean": 0.928125,
"rewards/reward_accuracy/std": 0.229570522159338,
"rewards/reward_format/mean": 0.0995898462831974,
"rewards/reward_format/std": 0.0036178498528897764,
"sampling/importance_sampling_ratio/max": 2.3006074905395506,
"sampling/importance_sampling_ratio/mean": 0.993562376499176,
"sampling/importance_sampling_ratio/min": 0.17180512547492982,
"sampling/sampling_logp_difference/max": 0.84302898645401,
"sampling/sampling_logp_difference/mean": 0.00442996525671333,
"step": 4730,
"step_time": 6.586040171704371
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1501.6,
"completions/max_terminated_length": 1255.2,
"completions/mean_length": 180.47578125,
"completions/mean_terminated_length": 169.57427368164062,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.061221639858558774,
"epoch": 10.149892933618844,
"frac_reward_zero_std": 0.78125,
"grad_norm": 0.75390625,
"learning_rate": 9.5261e-06,
"loss": -0.0113,
"num_tokens": 505816755.0,
"reward": 1.0259961187839508,
"reward_std": 0.23059847727417945,
"rewards/reward_accuracy/mean": 0.9265625,
"rewards/reward_accuracy/std": 0.22877169400453568,
"rewards/reward_format/mean": 0.09943359643220902,
"rewards/reward_format/std": 0.004968299949541688,
"sampling/importance_sampling_ratio/max": 2.4251923322677613,
"sampling/importance_sampling_ratio/mean": 0.9854008078575134,
"sampling/importance_sampling_ratio/min": 0.11076391004025936,
"sampling/sampling_logp_difference/max": 0.863700783252716,
"sampling/sampling_logp_difference/mean": 0.0045782451052218676,
"step": 4740,
"step_time": 7.2587615998083495
},
{
"clip_ratio/high_max": 8.630609954707325e-06,
"clip_ratio/high_mean": 1.0788262443384156e-06,
"clip_ratio/low_mean": 1.6553380419281894e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.7341642862666047e-06,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 1529.6,
"completions/max_terminated_length": 1247.3,
"completions/mean_length": 188.034375,
"completions/mean_terminated_length": 166.43729400634766,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.058233331446535884,
"epoch": 10.171306209850107,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.0,
"learning_rate": 9.5251e-06,
"loss": -0.0091,
"num_tokens": 506818043.0,
"reward": 1.0294140934944154,
"reward_std": 0.20186097249388696,
"rewards/reward_accuracy/mean": 0.93046875,
"rewards/reward_accuracy/std": 0.19880061745643615,
"rewards/reward_format/mean": 0.09894531369209289,
"rewards/reward_format/std": 0.0070452122949063774,
"sampling/importance_sampling_ratio/max": 2.5156790614128113,
"sampling/importance_sampling_ratio/mean": 0.9822251498699188,
"sampling/importance_sampling_ratio/min": 0.1074827689677477,
"sampling/sampling_logp_difference/max": 1.094046139717102,
"sampling/sampling_logp_difference/mean": 0.004310228512622416,
"step": 4750,
"step_time": 7.640354133295477
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1730.3,
"completions/max_terminated_length": 1638.2,
"completions/mean_length": 187.036328125,
"completions/mean_terminated_length": 169.59925079345703,
"completions/min_length": 62.2,
"completions/min_terminated_length": 62.2,
"entropy": 0.0637752067297697,
"epoch": 10.192719486081371,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.28125,
"learning_rate": 9.524100000000001e-06,
"loss": 0.0003,
"num_tokens": 507817384.0,
"reward": 1.022851574420929,
"reward_std": 0.2416798822581768,
"rewards/reward_accuracy/mean": 0.9234375,
"rewards/reward_accuracy/std": 0.23970472291111947,
"rewards/reward_format/mean": 0.09941406324505805,
"rewards/reward_format/std": 0.004501550481654704,
"sampling/importance_sampling_ratio/max": 2.417951261997223,
"sampling/importance_sampling_ratio/mean": 0.9614442825317383,
"sampling/importance_sampling_ratio/min": 0.0709114545956254,
"sampling/sampling_logp_difference/max": 0.7886774897575378,
"sampling/sampling_logp_difference/mean": 0.004624262917786837,
"step": 4760,
"step_time": 8.629712877390556
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.8019359004028957e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.8019359004028957e-06,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1640.2,
"completions/max_terminated_length": 1434.9,
"completions/mean_length": 170.98828125,
"completions/mean_terminated_length": 155.6591064453125,
"completions/min_length": 62.8,
"completions/min_terminated_length": 62.8,
"entropy": 0.06614671815186739,
"epoch": 10.214132762312634,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.84765625,
"learning_rate": 9.5231e-06,
"loss": -0.012,
"num_tokens": 508769834.0,
"reward": 1.0341406464576721,
"reward_std": 0.23185068890452384,
"rewards/reward_accuracy/mean": 0.934765625,
"rewards/reward_accuracy/std": 0.2300224594771862,
"rewards/reward_format/mean": 0.09937500134110451,
"rewards/reward_format/std": 0.00468291942961514,
"sampling/importance_sampling_ratio/max": 2.3970874190330504,
"sampling/importance_sampling_ratio/mean": 0.9731112778186798,
"sampling/importance_sampling_ratio/min": 0.08102073594927788,
"sampling/sampling_logp_difference/max": 1.4270949900150298,
"sampling/sampling_logp_difference/mean": 0.004857416357845068,
"step": 4770,
"step_time": 7.946768122905633
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01328125,
"completions/max_length": 1665.5,
"completions/max_terminated_length": 1309.2,
"completions/mean_length": 201.6921875,
"completions/mean_terminated_length": 177.18009719848632,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.06439845678396523,
"epoch": 10.235546038543898,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.6875,
"learning_rate": 9.522100000000002e-06,
"loss": -0.0048,
"num_tokens": 509808550.0,
"reward": 1.0194921910762786,
"reward_std": 0.24058351144194604,
"rewards/reward_accuracy/mean": 0.920703125,
"rewards/reward_accuracy/std": 0.2367585062980652,
"rewards/reward_format/mean": 0.09878906309604644,
"rewards/reward_format/std": 0.00804218566045165,
"sampling/importance_sampling_ratio/max": 2.4193350076675415,
"sampling/importance_sampling_ratio/mean": 0.9816176116466522,
"sampling/importance_sampling_ratio/min": 0.12780227214097978,
"sampling/sampling_logp_difference/max": 1.0167337298393249,
"sampling/sampling_logp_difference/mean": 0.00474659891333431,
"step": 4780,
"step_time": 8.285175189297297
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1631.8,
"completions/max_terminated_length": 1393.3,
"completions/mean_length": 168.420703125,
"completions/mean_terminated_length": 160.3967712402344,
"completions/min_length": 60.7,
"completions/min_terminated_length": 60.7,
"entropy": 0.05787048148922622,
"epoch": 10.25695931477516,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.34375,
"learning_rate": 9.521100000000001e-06,
"loss": -0.0092,
"num_tokens": 510765451.0,
"reward": 1.0382226705551147,
"reward_std": 0.21986900866031647,
"rewards/reward_accuracy/mean": 0.938671875,
"rewards/reward_accuracy/std": 0.21822658851742743,
"rewards/reward_format/mean": 0.0995507813990116,
"rewards/reward_format/std": 0.004924914822913707,
"sampling/importance_sampling_ratio/max": 2.4012659788131714,
"sampling/importance_sampling_ratio/mean": 0.9833254992961884,
"sampling/importance_sampling_ratio/min": 0.13488417491316795,
"sampling/sampling_logp_difference/max": 0.8806165933609009,
"sampling/sampling_logp_difference/mean": 0.004511522315442562,
"step": 4790,
"step_time": 7.795725439387025
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1287.1,
"completions/max_terminated_length": 1092.7,
"completions/mean_length": 157.4640625,
"completions/mean_terminated_length": 147.88981094360352,
"completions/min_length": 61.2,
"completions/min_terminated_length": 61.2,
"entropy": 0.05190957682207227,
"epoch": 10.278372591006423,
"frac_reward_zero_std": 0.8375,
"grad_norm": 1.140625,
"learning_rate": 9.5201e-06,
"loss": -0.0036,
"num_tokens": 511688927.0,
"reward": 1.0475976824760438,
"reward_std": 0.19250998198986052,
"rewards/reward_accuracy/mean": 0.948046875,
"rewards/reward_accuracy/std": 0.19086178690195083,
"rewards/reward_format/mean": 0.0995507813990116,
"rewards/reward_format/std": 0.0038563163951039316,
"sampling/importance_sampling_ratio/max": 2.300386071205139,
"sampling/importance_sampling_ratio/mean": 0.9845667541027069,
"sampling/importance_sampling_ratio/min": 0.13317147516645492,
"sampling/sampling_logp_difference/max": 1.20478093624115,
"sampling/sampling_logp_difference/mean": 0.004008870734833181,
"step": 4800,
"step_time": 6.474248615291435
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1707.3,
"completions/max_terminated_length": 1521.6,
"completions/mean_length": 188.6109375,
"completions/mean_terminated_length": 168.157421875,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"entropy": 0.0667593811172992,
"epoch": 10.299785867237688,
"frac_reward_zero_std": 0.8125,
"grad_norm": 0.330078125,
"learning_rate": 9.519100000000002e-06,
"loss": -0.0202,
"num_tokens": 512692939.0,
"reward": 1.0451757907867432,
"reward_std": 0.21652201414108277,
"rewards/reward_accuracy/mean": 0.94609375,
"rewards/reward_accuracy/std": 0.2130692146718502,
"rewards/reward_format/mean": 0.09908203184604644,
"rewards/reward_format/std": 0.007159696845337749,
"sampling/importance_sampling_ratio/max": 2.568993401527405,
"sampling/importance_sampling_ratio/mean": 0.9806936919689179,
"sampling/importance_sampling_ratio/min": 0.06751054003834725,
"sampling/sampling_logp_difference/max": 0.965716826915741,
"sampling/sampling_logp_difference/mean": 0.004942614398896694,
"step": 4810,
"step_time": 8.501069509304944
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1607.8,
"completions/max_terminated_length": 1478.6,
"completions/mean_length": 176.783984375,
"completions/mean_terminated_length": 168.04881439208984,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.06027210045140237,
"epoch": 10.32119914346895,
"frac_reward_zero_std": 0.83125,
"grad_norm": 0.1005859375,
"learning_rate": 9.518100000000001e-06,
"loss": -0.0045,
"num_tokens": 513666594.0,
"reward": 1.0474804878234862,
"reward_std": 0.19985100626945496,
"rewards/reward_accuracy/mean": 0.948046875,
"rewards/reward_accuracy/std": 0.19742033034563064,
"rewards/reward_format/mean": 0.09943359494209289,
"rewards/reward_format/std": 0.005258726142346859,
"sampling/importance_sampling_ratio/max": 2.3125514507293703,
"sampling/importance_sampling_ratio/mean": 0.9734965562820435,
"sampling/importance_sampling_ratio/min": 0.11263624653220176,
"sampling/sampling_logp_difference/max": 0.9144737303256989,
"sampling/sampling_logp_difference/mean": 0.004489839519374072,
"step": 4820,
"step_time": 7.633797021885402
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1721.2,
"completions/max_terminated_length": 1452.7,
"completions/mean_length": 189.158203125,
"completions/mean_terminated_length": 175.531640625,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.06439017960801721,
"epoch": 10.342612419700215,
"frac_reward_zero_std": 0.8125,
"grad_norm": 0.080078125,
"learning_rate": 9.5171e-06,
"loss": -0.0079,
"num_tokens": 514668199.0,
"reward": 1.017128938436508,
"reward_std": 0.25230552181601523,
"rewards/reward_accuracy/mean": 0.91796875,
"rewards/reward_accuracy/std": 0.24981200695037842,
"rewards/reward_format/mean": 0.09916015788912773,
"rewards/reward_format/std": 0.006714272918179632,
"sampling/importance_sampling_ratio/max": 2.6190020561218263,
"sampling/importance_sampling_ratio/mean": 0.9816635012626648,
"sampling/importance_sampling_ratio/min": 0.061282921419478956,
"sampling/sampling_logp_difference/max": 0.8060807943344116,
"sampling/sampling_logp_difference/mean": 0.004747221758589148,
"step": 4830,
"step_time": 8.192182301488355
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1326.2,
"completions/max_terminated_length": 1215.1,
"completions/mean_length": 185.003125,
"completions/mean_terminated_length": 172.852587890625,
"completions/min_length": 70.4,
"completions/min_terminated_length": 70.4,
"entropy": 0.060232422221451996,
"epoch": 10.364025695931478,
"frac_reward_zero_std": 0.85625,
"grad_norm": 1.515625,
"learning_rate": 9.5161e-06,
"loss": 0.0025,
"num_tokens": 515665167.0,
"reward": 1.0563085973262787,
"reward_std": 0.1730630673468113,
"rewards/reward_accuracy/mean": 0.95703125,
"rewards/reward_accuracy/std": 0.1708984263241291,
"rewards/reward_format/mean": 0.09927734434604644,
"rewards/reward_format/std": 0.0048108239425346255,
"sampling/importance_sampling_ratio/max": 2.4321522235870363,
"sampling/importance_sampling_ratio/mean": 0.9857188820838928,
"sampling/importance_sampling_ratio/min": 0.1627669781446457,
"sampling/sampling_logp_difference/max": 0.9031266927719116,
"sampling/sampling_logp_difference/mean": 0.004445074358955026,
"step": 4840,
"step_time": 6.552906964186695
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.497350172030565e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.497350172030565e-06,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1738.7,
"completions/max_terminated_length": 1664.6,
"completions/mean_length": 198.104296875,
"completions/mean_terminated_length": 179.36346740722655,
"completions/min_length": 62.3,
"completions/min_terminated_length": 62.3,
"entropy": 0.066652019508183,
"epoch": 10.38543897216274,
"frac_reward_zero_std": 0.84375,
"grad_norm": 0.73828125,
"learning_rate": 9.5151e-06,
"loss": -0.0091,
"num_tokens": 516691786.0,
"reward": 1.0421289205551147,
"reward_std": 0.20791791006922722,
"rewards/reward_accuracy/mean": 0.94296875,
"rewards/reward_accuracy/std": 0.20529475137591363,
"rewards/reward_format/mean": 0.09916015714406967,
"rewards/reward_format/std": 0.00616649508010596,
"sampling/importance_sampling_ratio/max": 2.532863903045654,
"sampling/importance_sampling_ratio/mean": 0.9797092854976654,
"sampling/importance_sampling_ratio/min": 0.04193511158227921,
"sampling/sampling_logp_difference/max": 0.8018358051776886,
"sampling/sampling_logp_difference/mean": 0.004547723289579153,
"step": 4850,
"step_time": 8.891044192691334
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1790.6,
"completions/max_terminated_length": 1713.3,
"completions/mean_length": 189.273828125,
"completions/mean_terminated_length": 178.59388122558593,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.06715535661205649,
"epoch": 10.406852248394005,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.1572265625,
"learning_rate": 9.514100000000001e-06,
"loss": -0.0076,
"num_tokens": 517695559.0,
"reward": 1.03720703125,
"reward_std": 0.2265087731182575,
"rewards/reward_accuracy/mean": 0.937890625,
"rewards/reward_accuracy/std": 0.22407255470752716,
"rewards/reward_format/mean": 0.09931640550494195,
"rewards/reward_format/std": 0.004834939050488174,
"sampling/importance_sampling_ratio/max": 2.4905220746994017,
"sampling/importance_sampling_ratio/mean": 0.978179144859314,
"sampling/importance_sampling_ratio/min": 0.07820064034312964,
"sampling/sampling_logp_difference/max": 0.9956794381141663,
"sampling/sampling_logp_difference/mean": 0.004828765080310405,
"step": 4860,
"step_time": 8.719576727011008
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1607.1,
"completions/max_terminated_length": 1255.2,
"completions/mean_length": 168.34140625,
"completions/mean_terminated_length": 155.7905715942383,
"completions/min_length": 62.7,
"completions/min_terminated_length": 62.7,
"entropy": 0.05395435653626919,
"epoch": 10.428265524625267,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.453125,
"learning_rate": 9.5131e-06,
"loss": -0.0068,
"num_tokens": 518644289.0,
"reward": 1.0585156321525573,
"reward_std": 0.17474367767572402,
"rewards/reward_accuracy/mean": 0.958984375,
"rewards/reward_accuracy/std": 0.17259304970502853,
"rewards/reward_format/mean": 0.09953125044703484,
"rewards/reward_format/std": 0.004842096497304738,
"sampling/importance_sampling_ratio/max": 2.5250635147094727,
"sampling/importance_sampling_ratio/mean": 0.9895753800868988,
"sampling/importance_sampling_ratio/min": 0.11430955780670046,
"sampling/sampling_logp_difference/max": 0.9589114427566529,
"sampling/sampling_logp_difference/mean": 0.00436220255214721,
"step": 4870,
"step_time": 7.902452426901436
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1850.7,
"completions/max_terminated_length": 1522.0,
"completions/mean_length": 167.548046875,
"completions/mean_terminated_length": 157.2882293701172,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.05894123134203255,
"epoch": 10.449678800856532,
"frac_reward_zero_std": 0.83125,
"grad_norm": 1.046875,
"learning_rate": 9.5121e-06,
"loss": -0.0095,
"num_tokens": 519581884.0,
"reward": 1.044003927707672,
"reward_std": 0.21100990623235702,
"rewards/reward_accuracy/mean": 0.94453125,
"rewards/reward_accuracy/std": 0.20875885114073753,
"rewards/reward_format/mean": 0.0994726575911045,
"rewards/reward_format/std": 0.005417788284830749,
"sampling/importance_sampling_ratio/max": 2.57973575592041,
"sampling/importance_sampling_ratio/mean": 1.007142961025238,
"sampling/importance_sampling_ratio/min": 0.12266335990279913,
"sampling/sampling_logp_difference/max": 0.8252570629119873,
"sampling/sampling_logp_difference/mean": 0.004540077340789139,
"step": 4880,
"step_time": 8.703042882308363
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1758.0,
"completions/max_terminated_length": 1343.9,
"completions/mean_length": 191.475390625,
"completions/mean_terminated_length": 171.30794525146484,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.06640867036767303,
"epoch": 10.471092077087794,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.37890625,
"learning_rate": 9.511100000000001e-06,
"loss": -0.0118,
"num_tokens": 520588541.0,
"reward": 0.9967969119548797,
"reward_std": 0.2797850653529167,
"rewards/reward_accuracy/mean": 0.89765625,
"rewards/reward_accuracy/std": 0.2776327133178711,
"rewards/reward_format/mean": 0.09914062619209289,
"rewards/reward_format/std": 0.006297014886513352,
"sampling/importance_sampling_ratio/max": 2.5109572410583496,
"sampling/importance_sampling_ratio/mean": 0.9774706065654755,
"sampling/importance_sampling_ratio/min": 0.0920160211622715,
"sampling/sampling_logp_difference/max": 0.9101097106933593,
"sampling/sampling_logp_difference/mean": 0.004767156671732664,
"step": 4890,
"step_time": 8.247095049102791
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1675.8,
"completions/max_terminated_length": 1228.7,
"completions/mean_length": 192.349609375,
"completions/mean_terminated_length": 173.69316864013672,
"completions/min_length": 70.3,
"completions/min_terminated_length": 70.3,
"entropy": 0.05977050682995468,
"epoch": 10.492505353319057,
"frac_reward_zero_std": 0.8125,
"grad_norm": 0.64453125,
"learning_rate": 9.5101e-06,
"loss": -0.0069,
"num_tokens": 521604780.0,
"reward": 1.0299023509025573,
"reward_std": 0.22975466251373292,
"rewards/reward_accuracy/mean": 0.930859375,
"rewards/reward_accuracy/std": 0.22696456387639047,
"rewards/reward_format/mean": 0.09904296919703484,
"rewards/reward_format/std": 0.0061457390431314705,
"sampling/importance_sampling_ratio/max": 2.5601959228515625,
"sampling/importance_sampling_ratio/mean": 0.9767778754234314,
"sampling/importance_sampling_ratio/min": 0.12419143058359623,
"sampling/sampling_logp_difference/max": 0.940182375907898,
"sampling/sampling_logp_difference/mean": 0.00461801050696522,
"step": 4900,
"step_time": 8.11044835978537
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1338.1,
"completions/max_terminated_length": 1241.4,
"completions/mean_length": 161.245703125,
"completions/mean_terminated_length": 151.65987396240234,
"completions/min_length": 68.5,
"completions/min_terminated_length": 68.5,
"entropy": 0.054667959664948286,
"epoch": 10.513918629550322,
"frac_reward_zero_std": 0.84375,
"grad_norm": 0.578125,
"learning_rate": 9.509100000000002e-06,
"loss": -0.0111,
"num_tokens": 522535745.0,
"reward": 1.0404882907867432,
"reward_std": 0.2296967625617981,
"rewards/reward_accuracy/mean": 0.941015625,
"rewards/reward_accuracy/std": 0.22757843211293222,
"rewards/reward_format/mean": 0.09947265684604645,
"rewards/reward_format/std": 0.004312735446728766,
"sampling/importance_sampling_ratio/max": 2.3191928386688234,
"sampling/importance_sampling_ratio/mean": 0.985667246580124,
"sampling/importance_sampling_ratio/min": 0.15007615637732669,
"sampling/sampling_logp_difference/max": 1.1841680228710174,
"sampling/sampling_logp_difference/mean": 0.004358755517750978,
"step": 4910,
"step_time": 6.577624199195998
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1694.3,
"completions/max_terminated_length": 1605.2,
"completions/mean_length": 201.530859375,
"completions/mean_terminated_length": 178.30618286132812,
"completions/min_length": 67.4,
"completions/min_terminated_length": 67.4,
"entropy": 0.07921906840056181,
"epoch": 10.535331905781584,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.48046875,
"learning_rate": 9.508100000000001e-06,
"loss": -0.0131,
"num_tokens": 523570960.0,
"reward": 1.0405273735523224,
"reward_std": 0.2073608286678791,
"rewards/reward_accuracy/mean": 0.94140625,
"rewards/reward_accuracy/std": 0.20449340716004372,
"rewards/reward_format/mean": 0.09912109300494194,
"rewards/reward_format/std": 0.006805268581956625,
"sampling/importance_sampling_ratio/max": 2.647536587715149,
"sampling/importance_sampling_ratio/mean": 0.9840967714786529,
"sampling/importance_sampling_ratio/min": 0.09064562804996967,
"sampling/sampling_logp_difference/max": 1.0020837903022766,
"sampling/sampling_logp_difference/mean": 0.0053715439513325695,
"step": 4920,
"step_time": 8.303140740393427
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1541.1,
"completions/max_terminated_length": 1130.4,
"completions/mean_length": 165.16484375,
"completions/mean_terminated_length": 151.87400817871094,
"completions/min_length": 66.4,
"completions/min_terminated_length": 66.4,
"entropy": 0.056129126669839026,
"epoch": 10.556745182012849,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.80859375,
"learning_rate": 9.5071e-06,
"loss": -0.0101,
"num_tokens": 524511510.0,
"reward": 1.0544336199760438,
"reward_std": 0.17801789045333863,
"rewards/reward_accuracy/mean": 0.955078125,
"rewards/reward_accuracy/std": 0.17561742439866065,
"rewards/reward_format/mean": 0.09935546964406967,
"rewards/reward_format/std": 0.005762723460793495,
"sampling/importance_sampling_ratio/max": 2.5803240537643433,
"sampling/importance_sampling_ratio/mean": 0.9889614999294281,
"sampling/importance_sampling_ratio/min": 0.12470354400575161,
"sampling/sampling_logp_difference/max": 0.8519905924797058,
"sampling/sampling_logp_difference/mean": 0.004304653685539961,
"step": 4930,
"step_time": 7.419522124898504
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1737.1,
"completions/max_terminated_length": 1428.4,
"completions/mean_length": 168.779296875,
"completions/mean_terminated_length": 161.42705993652345,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.06257218103855848,
"epoch": 10.578158458244111,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.1875,
"learning_rate": 9.5061e-06,
"loss": -0.009,
"num_tokens": 525462833.0,
"reward": 1.050292980670929,
"reward_std": 0.20444991290569306,
"rewards/reward_accuracy/mean": 0.95078125,
"rewards/reward_accuracy/std": 0.20212208330631257,
"rewards/reward_format/mean": 0.09951171949505806,
"rewards/reward_format/std": 0.004507700470276177,
"sampling/importance_sampling_ratio/max": 2.499669003486633,
"sampling/importance_sampling_ratio/mean": 0.9877623021602631,
"sampling/importance_sampling_ratio/min": 0.06321159228682519,
"sampling/sampling_logp_difference/max": 0.9507557034492493,
"sampling/sampling_logp_difference/mean": 0.004662231239490211,
"step": 4940,
"step_time": 8.259411361205276
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1765.8,
"completions/max_terminated_length": 1633.9,
"completions/mean_length": 173.028125,
"completions/mean_terminated_length": 158.29537963867188,
"completions/min_length": 60.1,
"completions/min_terminated_length": 60.1,
"entropy": 0.06058974452316761,
"epoch": 10.599571734475374,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.62109375,
"learning_rate": 9.5051e-06,
"loss": -0.0097,
"num_tokens": 526426441.0,
"reward": 1.0500585973262786,
"reward_std": 0.19576002210378646,
"rewards/reward_accuracy/mean": 0.95078125,
"rewards/reward_accuracy/std": 0.19334555566310882,
"rewards/reward_format/mean": 0.09927734434604644,
"rewards/reward_format/std": 0.005874263332225382,
"sampling/importance_sampling_ratio/max": 2.518196773529053,
"sampling/importance_sampling_ratio/mean": 0.9842970311641693,
"sampling/importance_sampling_ratio/min": 0.05216323435306549,
"sampling/sampling_logp_difference/max": 0.9797549843788147,
"sampling/sampling_logp_difference/mean": 0.004816990555264055,
"step": 4950,
"step_time": 8.563594775792444
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1376.0,
"completions/max_terminated_length": 1348.2,
"completions/mean_length": 188.064453125,
"completions/mean_terminated_length": 176.33844451904298,
"completions/min_length": 65.7,
"completions/min_terminated_length": 65.7,
"entropy": 0.06498868255876004,
"epoch": 10.620985010706638,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.396484375,
"learning_rate": 9.504100000000001e-06,
"loss": -0.0027,
"num_tokens": 527428510.0,
"reward": 1.0467968821525573,
"reward_std": 0.17765992358326912,
"rewards/reward_accuracy/mean": 0.947265625,
"rewards/reward_accuracy/std": 0.17652232125401496,
"rewards/reward_format/mean": 0.09953125044703484,
"rewards/reward_format/std": 0.0038446391467005015,
"sampling/importance_sampling_ratio/max": 2.5173779249191286,
"sampling/importance_sampling_ratio/mean": 0.9779905200004577,
"sampling/importance_sampling_ratio/min": 0.05153975230641663,
"sampling/sampling_logp_difference/max": 1.2321288108825683,
"sampling/sampling_logp_difference/mean": 0.004597343038767576,
"step": 4960,
"step_time": 7.0261391758103855
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1783.8,
"completions/max_terminated_length": 1548.7,
"completions/mean_length": 178.753125,
"completions/mean_terminated_length": 169.1849136352539,
"completions/min_length": 65.7,
"completions/min_terminated_length": 65.7,
"entropy": 0.061328459344804284,
"epoch": 10.642398286937901,
"frac_reward_zero_std": 0.85,
"grad_norm": 1.6328125,
"learning_rate": 9.5031e-06,
"loss": 0.0007,
"num_tokens": 528395510.0,
"reward": 1.0425000131130218,
"reward_std": 0.21011030524969102,
"rewards/reward_accuracy/mean": 0.94296875,
"rewards/reward_accuracy/std": 0.20801644995808602,
"rewards/reward_format/mean": 0.09953125044703484,
"rewards/reward_format/std": 0.0050258355680853125,
"sampling/importance_sampling_ratio/max": 2.380945920944214,
"sampling/importance_sampling_ratio/mean": 0.9772957384586334,
"sampling/importance_sampling_ratio/min": 0.0770795164629817,
"sampling/sampling_logp_difference/max": 0.9506788969039917,
"sampling/sampling_logp_difference/mean": 0.004587779147550463,
"step": 4970,
"step_time": 8.527854624408064
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1791.4,
"completions/max_terminated_length": 1468.7,
"completions/mean_length": 180.658203125,
"completions/mean_terminated_length": 170.4064514160156,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"entropy": 0.06532882642932236,
"epoch": 10.663811563169165,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.50390625,
"learning_rate": 9.5021e-06,
"loss": -0.0053,
"num_tokens": 529372555.0,
"reward": 1.0521093606948853,
"reward_std": 0.19298113584518434,
"rewards/reward_accuracy/mean": 0.952734375,
"rewards/reward_accuracy/std": 0.1907479867339134,
"rewards/reward_format/mean": 0.09937499910593033,
"rewards/reward_format/std": 0.0063424535328522325,
"sampling/importance_sampling_ratio/max": 2.3844524025917053,
"sampling/importance_sampling_ratio/mean": 0.9835715889930725,
"sampling/importance_sampling_ratio/min": 0.10743230357766151,
"sampling/sampling_logp_difference/max": 0.9131993293762207,
"sampling/sampling_logp_difference/mean": 0.005010870844125747,
"step": 4980,
"step_time": 8.620281743415399
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1913.6,
"completions/max_terminated_length": 1302.2,
"completions/mean_length": 193.49296875,
"completions/mean_terminated_length": 170.3731658935547,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.06376608614809812,
"epoch": 10.685224839400428,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.259765625,
"learning_rate": 9.501100000000001e-06,
"loss": -0.0051,
"num_tokens": 530383609.0,
"reward": 1.0389453530311585,
"reward_std": 0.2234359435737133,
"rewards/reward_accuracy/mean": 0.940234375,
"rewards/reward_accuracy/std": 0.21905080378055572,
"rewards/reward_format/mean": 0.0987109400331974,
"rewards/reward_format/std": 0.009178919834084809,
"sampling/importance_sampling_ratio/max": 2.5072694182395936,
"sampling/importance_sampling_ratio/mean": 0.9788387715816498,
"sampling/importance_sampling_ratio/min": 0.041509222239255905,
"sampling/sampling_logp_difference/max": 0.8639187395572663,
"sampling/sampling_logp_difference/mean": 0.004684256832115352,
"step": 4990,
"step_time": 9.267114484400372
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1655.9,
"completions/max_terminated_length": 1544.3,
"completions/mean_length": 176.002734375,
"completions/mean_terminated_length": 164.3274658203125,
"completions/min_length": 61.9,
"completions/min_terminated_length": 61.9,
"entropy": 0.061247565876692535,
"epoch": 10.70663811563169,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.26953125,
"learning_rate": 9.5001e-06,
"loss": -0.0122,
"num_tokens": 531352544.0,
"reward": 1.0539844036102295,
"reward_std": 0.19136462435126306,
"rewards/reward_accuracy/mean": 0.9546875,
"rewards/reward_accuracy/std": 0.18862492814660073,
"rewards/reward_format/mean": 0.09929687678813934,
"rewards/reward_format/std": 0.006007603881880641,
"sampling/importance_sampling_ratio/max": 2.5179120540618896,
"sampling/importance_sampling_ratio/mean": 0.9842640697956085,
"sampling/importance_sampling_ratio/min": 0.06646091612055897,
"sampling/sampling_logp_difference/max": 1.0100312232971191,
"sampling/sampling_logp_difference/mean": 0.004716954194009304,
"step": 5000,
"step_time": 8.026638979997369
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1413.8,
"completions/max_terminated_length": 1273.6,
"completions/mean_length": 179.3625,
"completions/mean_terminated_length": 169.26962890625,
"completions/min_length": 57.8,
"completions/min_terminated_length": 57.8,
"entropy": 0.060890561412088574,
"epoch": 10.728051391862955,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.7734375,
"learning_rate": 9.499100000000002e-06,
"loss": -0.011,
"num_tokens": 532331664.0,
"reward": 1.0354101657867432,
"reward_std": 0.19689735993742943,
"rewards/reward_accuracy/mean": 0.9359375,
"rewards/reward_accuracy/std": 0.1956394322216511,
"rewards/reward_format/mean": 0.09947265684604645,
"rewards/reward_format/std": 0.003999705868773162,
"sampling/importance_sampling_ratio/max": 2.4473586797714235,
"sampling/importance_sampling_ratio/mean": 0.9744105696678161,
"sampling/importance_sampling_ratio/min": 0.11089488314464688,
"sampling/sampling_logp_difference/max": 0.9454531967639923,
"sampling/sampling_logp_difference/mean": 0.004448169562965632,
"step": 5010,
"step_time": 7.0631611654884185
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.010546875,
"completions/max_length": 1601.1,
"completions/max_terminated_length": 1375.0,
"completions/mean_length": 191.6484375,
"completions/mean_terminated_length": 172.32168273925782,
"completions/min_length": 67.5,
"completions/min_terminated_length": 67.5,
"entropy": 0.07100865344982595,
"epoch": 10.749464668094218,
"frac_reward_zero_std": 0.78125,
"grad_norm": 0.578125,
"learning_rate": 9.498100000000001e-06,
"loss": -0.0121,
"num_tokens": 533340636.0,
"reward": 1.0216992557048798,
"reward_std": 0.25049697384238245,
"rewards/reward_accuracy/mean": 0.92265625,
"rewards/reward_accuracy/std": 0.24796755388379096,
"rewards/reward_format/mean": 0.09904297068715096,
"rewards/reward_format/std": 0.0062851033639162775,
"sampling/importance_sampling_ratio/max": 2.4017580151557922,
"sampling/importance_sampling_ratio/mean": 0.9834074199199676,
"sampling/importance_sampling_ratio/min": 0.06948208697140217,
"sampling/sampling_logp_difference/max": 0.8319382190704345,
"sampling/sampling_logp_difference/mean": 0.005170321022160351,
"step": 5020,
"step_time": 7.9651552862895185
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.010546875,
"completions/max_length": 1752.7,
"completions/max_terminated_length": 1254.0,
"completions/mean_length": 179.16875,
"completions/mean_terminated_length": 159.47989654541016,
"completions/min_length": 67.7,
"completions/min_terminated_length": 67.7,
"entropy": 0.05798200184945017,
"epoch": 10.770877944325482,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.126953125,
"learning_rate": 9.497100000000001e-06,
"loss": -0.0054,
"num_tokens": 534315340.0,
"reward": 1.0346875190734863,
"reward_std": 0.21014132499694824,
"rewards/reward_accuracy/mean": 0.935546875,
"rewards/reward_accuracy/std": 0.2071576789021492,
"rewards/reward_format/mean": 0.09914062619209289,
"rewards/reward_format/std": 0.00630557129625231,
"sampling/importance_sampling_ratio/max": 2.5219523906707764,
"sampling/importance_sampling_ratio/mean": 0.9709899425506592,
"sampling/importance_sampling_ratio/min": 0.1402948744595051,
"sampling/sampling_logp_difference/max": 0.9116101145744324,
"sampling/sampling_logp_difference/mean": 0.004645608388818801,
"step": 5030,
"step_time": 8.364578777897986
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1330.3,
"completions/max_terminated_length": 1257.0,
"completions/mean_length": 159.0546875,
"completions/mean_terminated_length": 156.1301467895508,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"entropy": 0.05206541200168431,
"epoch": 10.792291220556745,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.625,
"learning_rate": 9.4961e-06,
"loss": -0.0061,
"num_tokens": 535235128.0,
"reward": 1.040019553899765,
"reward_std": 0.22289666011929513,
"rewards/reward_accuracy/mean": 0.940234375,
"rewards/reward_accuracy/std": 0.22215330451726914,
"rewards/reward_format/mean": 0.09978515803813934,
"rewards/reward_format/std": 0.0023850613739341497,
"sampling/importance_sampling_ratio/max": 2.5849648237228395,
"sampling/importance_sampling_ratio/mean": 0.9916244208812713,
"sampling/importance_sampling_ratio/min": 0.05618860200047493,
"sampling/sampling_logp_difference/max": 0.8660517692565918,
"sampling/sampling_logp_difference/mean": 0.0043643776327371596,
"step": 5040,
"step_time": 6.473774758016225
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.011328125,
"completions/max_length": 1625.2,
"completions/max_terminated_length": 1503.2,
"completions/mean_length": 199.3984375,
"completions/mean_terminated_length": 178.50812072753905,
"completions/min_length": 62.4,
"completions/min_terminated_length": 62.4,
"entropy": 0.06933032716624439,
"epoch": 10.81370449678801,
"frac_reward_zero_std": 0.80625,
"grad_norm": 0.53125,
"learning_rate": 9.4951e-06,
"loss": -0.0009,
"num_tokens": 536268260.0,
"reward": 1.0321679830551147,
"reward_std": 0.2390662208199501,
"rewards/reward_accuracy/mean": 0.933203125,
"rewards/reward_accuracy/std": 0.235712169110775,
"rewards/reward_format/mean": 0.09896484464406967,
"rewards/reward_format/std": 0.007749768299981951,
"sampling/importance_sampling_ratio/max": 2.5219187498092652,
"sampling/importance_sampling_ratio/mean": 0.9732260823249816,
"sampling/importance_sampling_ratio/min": 0.06438156310468912,
"sampling/sampling_logp_difference/max": 1.0320395827293396,
"sampling/sampling_logp_difference/mean": 0.0049195786006748675,
"step": 5050,
"step_time": 8.297622074306128
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1933.3,
"completions/max_terminated_length": 1768.3,
"completions/mean_length": 189.14765625,
"completions/mean_terminated_length": 174.5191749572754,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.06888531586155296,
"epoch": 10.835117773019272,
"frac_reward_zero_std": 0.8125,
"grad_norm": 0.5859375,
"learning_rate": 9.494100000000001e-06,
"loss": -0.0043,
"num_tokens": 537276206.0,
"reward": 1.0333203077316284,
"reward_std": 0.23198368400335312,
"rewards/reward_accuracy/mean": 0.933984375,
"rewards/reward_accuracy/std": 0.2294367402791977,
"rewards/reward_format/mean": 0.09933593720197678,
"rewards/reward_format/std": 0.005560057540424168,
"sampling/importance_sampling_ratio/max": 2.433537447452545,
"sampling/importance_sampling_ratio/mean": 0.9699625074863434,
"sampling/importance_sampling_ratio/min": 0.06549030318856239,
"sampling/sampling_logp_difference/max": 0.960605263710022,
"sampling/sampling_logp_difference/mean": 0.0051647849613800645,
"step": 5060,
"step_time": 9.201832664391258
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1463.1,
"completions/max_terminated_length": 1302.5,
"completions/mean_length": 157.896484375,
"completions/mean_terminated_length": 152.0487075805664,
"completions/min_length": 61.0,
"completions/min_terminated_length": 61.0,
"entropy": 0.049600338703021406,
"epoch": 10.856531049250535,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.0947265625,
"learning_rate": 9.4931e-06,
"loss": -0.0065,
"num_tokens": 538195045.0,
"reward": 1.0644726753234863,
"reward_std": 0.14768303856253623,
"rewards/reward_accuracy/mean": 0.96484375,
"rewards/reward_accuracy/std": 0.14619908556342126,
"rewards/reward_format/mean": 0.09962890669703484,
"rewards/reward_format/std": 0.002842136239632964,
"sampling/importance_sampling_ratio/max": 2.5179192066192626,
"sampling/importance_sampling_ratio/mean": 0.978805524110794,
"sampling/importance_sampling_ratio/min": 0.14073102306574584,
"sampling/sampling_logp_difference/max": 0.9670579254627227,
"sampling/sampling_logp_difference/mean": 0.00420946788508445,
"step": 5070,
"step_time": 7.062053836981067
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012109375,
"completions/max_length": 1852.0,
"completions/max_terminated_length": 1684.6,
"completions/mean_length": 187.401953125,
"completions/mean_terminated_length": 164.96627502441407,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.06113778813742101,
"epoch": 10.8779443254818,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.359375,
"learning_rate": 9.4921e-06,
"loss": 0.0005,
"num_tokens": 539188090.0,
"reward": 1.0340625166893005,
"reward_std": 0.23531625047326088,
"rewards/reward_accuracy/mean": 0.93515625,
"rewards/reward_accuracy/std": 0.2317979760468006,
"rewards/reward_format/mean": 0.09890625104308129,
"rewards/reward_format/std": 0.0074017565231770275,
"sampling/importance_sampling_ratio/max": 2.6104918003082274,
"sampling/importance_sampling_ratio/mean": 0.9885890483856201,
"sampling/importance_sampling_ratio/min": 0.014094465970993042,
"sampling/sampling_logp_difference/max": 1.0490563631057739,
"sampling/sampling_logp_difference/mean": 0.004772179154679179,
"step": 5080,
"step_time": 8.920507014595206
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1440.0,
"completions/max_terminated_length": 1231.7,
"completions/mean_length": 181.905859375,
"completions/mean_terminated_length": 165.98207092285156,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"entropy": 0.05985152896028012,
"epoch": 10.899357601713062,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.73828125,
"learning_rate": 9.491100000000001e-06,
"loss": -0.0082,
"num_tokens": 540168409.0,
"reward": 1.0539843916893006,
"reward_std": 0.183576500415802,
"rewards/reward_accuracy/mean": 0.9546875,
"rewards/reward_accuracy/std": 0.18087779283523558,
"rewards/reward_format/mean": 0.09929687604308128,
"rewards/reward_format/std": 0.00620755588170141,
"sampling/importance_sampling_ratio/max": 2.3989652752876283,
"sampling/importance_sampling_ratio/mean": 0.9863479197025299,
"sampling/importance_sampling_ratio/min": 0.12438343837857246,
"sampling/sampling_logp_difference/max": 0.8749351501464844,
"sampling/sampling_logp_difference/mean": 0.004483142727985978,
"step": 5090,
"step_time": 7.210674205698888
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1831.8,
"completions/max_terminated_length": 1385.9,
"completions/mean_length": 168.615234375,
"completions/mean_terminated_length": 159.80175323486327,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.058358646417036655,
"epoch": 10.920770877944326,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.6015625,
"learning_rate": 9.4901e-06,
"loss": -0.0059,
"num_tokens": 541108432.0,
"reward": 1.0663671970367432,
"reward_std": 0.1602984830737114,
"rewards/reward_accuracy/mean": 0.966796875,
"rewards/reward_accuracy/std": 0.15798837915062905,
"rewards/reward_format/mean": 0.09957031309604644,
"rewards/reward_format/std": 0.00445222130510956,
"sampling/importance_sampling_ratio/max": 2.410630702972412,
"sampling/importance_sampling_ratio/mean": 0.976587963104248,
"sampling/importance_sampling_ratio/min": 0.07771367169916629,
"sampling/sampling_logp_difference/max": 1.0072986602783203,
"sampling/sampling_logp_difference/mean": 0.004539587465114891,
"step": 5100,
"step_time": 8.771330959603073
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1898.9,
"completions/max_terminated_length": 1608.3,
"completions/mean_length": 191.1734375,
"completions/mean_terminated_length": 170.7742721557617,
"completions/min_length": 63.9,
"completions/min_terminated_length": 63.9,
"entropy": 0.07122287238016725,
"epoch": 10.942184154175589,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.296875,
"learning_rate": 9.4891e-06,
"loss": -0.0195,
"num_tokens": 542114844.0,
"reward": 1.0357617557048797,
"reward_std": 0.22245092913508416,
"rewards/reward_accuracy/mean": 0.93671875,
"rewards/reward_accuracy/std": 0.2189699426293373,
"rewards/reward_format/mean": 0.0990429699420929,
"rewards/reward_format/std": 0.007217798964120448,
"sampling/importance_sampling_ratio/max": 2.5026329278945925,
"sampling/importance_sampling_ratio/mean": 0.9850968062877655,
"sampling/importance_sampling_ratio/min": 0.04861032385379076,
"sampling/sampling_logp_difference/max": 0.9381913900375366,
"sampling/sampling_logp_difference/mean": 0.005056398455053568,
"step": 5110,
"step_time": 9.140805790093145
},
{
"clip_ratio/high_max": 2.1055586694274096e-05,
"clip_ratio/high_mean": 2.631948336784262e-06,
"clip_ratio/low_mean": 8.954698387242388e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.527418175508501e-06,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1648.9,
"completions/max_terminated_length": 1485.1,
"completions/mean_length": 179.505078125,
"completions/mean_terminated_length": 163.45447998046876,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"entropy": 0.056818334432318804,
"epoch": 10.963597430406852,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.28515625,
"learning_rate": 9.488100000000002e-06,
"loss": -0.0091,
"num_tokens": 543092073.0,
"reward": 1.0456445574760438,
"reward_std": 0.2060455046594143,
"rewards/reward_accuracy/mean": 0.946484375,
"rewards/reward_accuracy/std": 0.2031620606780052,
"rewards/reward_format/mean": 0.09916015788912773,
"rewards/reward_format/std": 0.006747024273499847,
"sampling/importance_sampling_ratio/max": 2.2676021814346314,
"sampling/importance_sampling_ratio/mean": 0.9805663049221038,
"sampling/importance_sampling_ratio/min": 0.03328915387392044,
"sampling/sampling_logp_difference/max": 0.9310858607292175,
"sampling/sampling_logp_difference/mean": 0.004668764700181782,
"step": 5120,
"step_time": 7.9051237400795795
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1429.9,
"completions/max_terminated_length": 1365.2,
"completions/mean_length": 176.266015625,
"completions/mean_terminated_length": 166.1843475341797,
"completions/min_length": 61.6,
"completions/min_terminated_length": 61.6,
"entropy": 0.06284216749481857,
"epoch": 10.985010706638116,
"frac_reward_zero_std": 0.83125,
"grad_norm": 0.0,
"learning_rate": 9.487100000000001e-06,
"loss": -0.0051,
"num_tokens": 544057490.0,
"reward": 1.0408593952655791,
"reward_std": 0.1936935055302456,
"rewards/reward_accuracy/mean": 0.94140625,
"rewards/reward_accuracy/std": 0.19186536148190497,
"rewards/reward_format/mean": 0.09945312589406967,
"rewards/reward_format/std": 0.004640272026881576,
"sampling/importance_sampling_ratio/max": 2.413148880004883,
"sampling/importance_sampling_ratio/mean": 0.9690215468406678,
"sampling/importance_sampling_ratio/min": 0.09565825276076793,
"sampling/sampling_logp_difference/max": 1.0108483910560608,
"sampling/sampling_logp_difference/mean": 0.004685469577088952,
"step": 5130,
"step_time": 7.007721991513972
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1824.1,
"completions/max_terminated_length": 1398.0,
"completions/mean_length": 177.50234375,
"completions/mean_terminated_length": 159.00880279541016,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.05938283989671618,
"epoch": 11.006423982869379,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.1416015625,
"learning_rate": 9.4861e-06,
"loss": -0.0,
"num_tokens": 545026168.0,
"reward": 1.0545117259025574,
"reward_std": 0.19561451375484468,
"rewards/reward_accuracy/mean": 0.95546875,
"rewards/reward_accuracy/std": 0.19164123386144638,
"rewards/reward_format/mean": 0.09904296919703484,
"rewards/reward_format/std": 0.0077475224621593956,
"sampling/importance_sampling_ratio/max": 2.2997281074523928,
"sampling/importance_sampling_ratio/mean": 0.9795707166194916,
"sampling/importance_sampling_ratio/min": 0.06044499799609184,
"sampling/sampling_logp_difference/max": 0.8376618027687073,
"sampling/sampling_logp_difference/mean": 0.004466478573158383,
"step": 5140,
"step_time": 8.98516305439407
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1434.2,
"completions/max_terminated_length": 1033.6,
"completions/mean_length": 168.68359375,
"completions/mean_terminated_length": 154.84099655151368,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"entropy": 0.0475707232253626,
"epoch": 11.027837259100643,
"frac_reward_zero_std": 0.84375,
"grad_norm": 0.333984375,
"learning_rate": 9.4851e-06,
"loss": -0.0033,
"num_tokens": 545979534.0,
"reward": 1.061777365207672,
"reward_std": 0.15608885511755943,
"rewards/reward_accuracy/mean": 0.9625,
"rewards/reward_accuracy/std": 0.15319904088973998,
"rewards/reward_format/mean": 0.0992773450911045,
"rewards/reward_format/std": 0.005373452324420214,
"sampling/importance_sampling_ratio/max": 2.341280722618103,
"sampling/importance_sampling_ratio/mean": 0.9899633347988128,
"sampling/importance_sampling_ratio/min": 0.15202223733067513,
"sampling/sampling_logp_difference/max": 1.1137134194374085,
"sampling/sampling_logp_difference/mean": 0.004106190265156328,
"step": 5150,
"step_time": 6.993594323590514
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1398.2,
"completions/max_terminated_length": 1151.1,
"completions/mean_length": 161.59453125,
"completions/mean_terminated_length": 154.21946411132814,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.04957383314613253,
"epoch": 11.049250535331906,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 9.484100000000001e-06,
"loss": 0.0019,
"num_tokens": 546911264.0,
"reward": 1.037890648841858,
"reward_std": 0.21197003945708276,
"rewards/reward_accuracy/mean": 0.93828125,
"rewards/reward_accuracy/std": 0.21021132543683052,
"rewards/reward_format/mean": 0.09960937649011611,
"rewards/reward_format/std": 0.00374532591085881,
"sampling/importance_sampling_ratio/max": 2.4210492968559265,
"sampling/importance_sampling_ratio/mean": 0.9840665876865387,
"sampling/importance_sampling_ratio/min": 0.07314805015921592,
"sampling/sampling_logp_difference/max": 0.9438265085220336,
"sampling/sampling_logp_difference/mean": 0.004263187060132623,
"step": 5160,
"step_time": 6.910571356603759
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1576.9,
"completions/max_terminated_length": 1199.2,
"completions/mean_length": 176.08359375,
"completions/mean_terminated_length": 160.7809310913086,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.05516621144488454,
"epoch": 11.070663811563168,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.333984375,
"learning_rate": 9.4831e-06,
"loss": -0.0094,
"num_tokens": 547881750.0,
"reward": 1.044609397649765,
"reward_std": 0.1996776893734932,
"rewards/reward_accuracy/mean": 0.9453125,
"rewards/reward_accuracy/std": 0.196830864995718,
"rewards/reward_format/mean": 0.09929687678813934,
"rewards/reward_format/std": 0.006117203924804926,
"sampling/importance_sampling_ratio/max": 2.558711659908295,
"sampling/importance_sampling_ratio/mean": 0.9802055299282074,
"sampling/importance_sampling_ratio/min": 0.12744237165898084,
"sampling/sampling_logp_difference/max": 0.8421024084091187,
"sampling/sampling_logp_difference/mean": 0.0042657186742872,
"step": 5170,
"step_time": 7.8284899654885525
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1409.6,
"completions/max_terminated_length": 994.9,
"completions/mean_length": 159.89140625,
"completions/mean_terminated_length": 151.82794799804688,
"completions/min_length": 59.5,
"completions/min_terminated_length": 59.5,
"entropy": 0.051300633884966376,
"epoch": 11.092077087794433,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0,
"learning_rate": 9.4821e-06,
"loss": -0.0016,
"num_tokens": 548801424.0,
"reward": 1.055566418170929,
"reward_std": 0.1968259960412979,
"rewards/reward_accuracy/mean": 0.955859375,
"rewards/reward_accuracy/std": 0.1955209568142891,
"rewards/reward_format/mean": 0.09970703199505807,
"rewards/reward_format/std": 0.003348551061935723,
"sampling/importance_sampling_ratio/max": 2.298784005641937,
"sampling/importance_sampling_ratio/mean": 0.9908873558044433,
"sampling/importance_sampling_ratio/min": 0.14213005900382997,
"sampling/sampling_logp_difference/max": 0.9381953835487366,
"sampling/sampling_logp_difference/mean": 0.004465310578234493,
"step": 5180,
"step_time": 6.861818974019843
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1531.1,
"completions/max_terminated_length": 1304.0,
"completions/mean_length": 183.21875,
"completions/mean_terminated_length": 167.37647399902343,
"completions/min_length": 67.3,
"completions/min_terminated_length": 67.3,
"entropy": 0.05839127979706973,
"epoch": 11.113490364025695,
"frac_reward_zero_std": 0.84375,
"grad_norm": 0.62890625,
"learning_rate": 9.481100000000001e-06,
"loss": 0.0013,
"num_tokens": 549787184.0,
"reward": 1.0334961235523223,
"reward_std": 0.22554379552602768,
"rewards/reward_accuracy/mean": 0.934375,
"rewards/reward_accuracy/std": 0.22297546789050102,
"rewards/reward_format/mean": 0.09912109449505806,
"rewards/reward_format/std": 0.006672433484345675,
"sampling/importance_sampling_ratio/max": 2.568999409675598,
"sampling/importance_sampling_ratio/mean": 0.9755833625793457,
"sampling/importance_sampling_ratio/min": 0.08931943904608489,
"sampling/sampling_logp_difference/max": 0.8387944579124451,
"sampling/sampling_logp_difference/mean": 0.004511095304042101,
"step": 5190,
"step_time": 7.638182469207095
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1973.6,
"completions/max_terminated_length": 1627.9,
"completions/mean_length": 190.738671875,
"completions/mean_terminated_length": 175.45734100341798,
"completions/min_length": 67.3,
"completions/min_terminated_length": 67.3,
"entropy": 0.061087565426714716,
"epoch": 11.13490364025696,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.28515625,
"learning_rate": 9.480100000000001e-06,
"loss": -0.0091,
"num_tokens": 550796723.0,
"reward": 1.0261719048023223,
"reward_std": 0.23681776970624924,
"rewards/reward_accuracy/mean": 0.926953125,
"rewards/reward_accuracy/std": 0.23395804837346076,
"rewards/reward_format/mean": 0.09921875298023224,
"rewards/reward_format/std": 0.0073929945006966594,
"sampling/importance_sampling_ratio/max": 2.455276274681091,
"sampling/importance_sampling_ratio/mean": 0.980702155828476,
"sampling/importance_sampling_ratio/min": 0.04144332595169544,
"sampling/sampling_logp_difference/max": 0.9862715840339661,
"sampling/sampling_logp_difference/mean": 0.004531967430375516,
"step": 5200,
"step_time": 9.552436894716811
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.695696664683055e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.695696664683055e-06,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 1660.8,
"completions/max_terminated_length": 1396.3,
"completions/mean_length": 206.140234375,
"completions/mean_terminated_length": 185.93787994384766,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.06175266755744815,
"epoch": 11.156316916488223,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.0,
"learning_rate": 9.4791e-06,
"loss": -0.0081,
"num_tokens": 551839914.0,
"reward": 1.0245507836341858,
"reward_std": 0.21261753290891647,
"rewards/reward_accuracy/mean": 0.92578125,
"rewards/reward_accuracy/std": 0.2098153568804264,
"rewards/reward_format/mean": 0.09876953065395355,
"rewards/reward_format/std": 0.006349330232478678,
"sampling/importance_sampling_ratio/max": 2.637651062011719,
"sampling/importance_sampling_ratio/mean": 0.9880752623081207,
"sampling/importance_sampling_ratio/min": 0.10464849919080735,
"sampling/sampling_logp_difference/max": 1.1852705359458924,
"sampling/sampling_logp_difference/mean": 0.0045935926027596,
"step": 5210,
"step_time": 7.987527731800219
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01328125,
"completions/max_length": 1487.3,
"completions/max_terminated_length": 1325.8,
"completions/mean_length": 189.3609375,
"completions/mean_terminated_length": 164.66039123535157,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.06005175532773137,
"epoch": 11.177730192719487,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.26953125,
"learning_rate": 9.478100000000002e-06,
"loss": -0.0084,
"num_tokens": 552847718.0,
"reward": 1.0456836342811584,
"reward_std": 0.17861257195472718,
"rewards/reward_accuracy/mean": 0.946875,
"rewards/reward_accuracy/std": 0.17459421679377557,
"rewards/reward_format/mean": 0.09880859628319741,
"rewards/reward_format/std": 0.0066472083330154415,
"sampling/importance_sampling_ratio/max": 2.623581290245056,
"sampling/importance_sampling_ratio/mean": 0.9898178517818451,
"sampling/importance_sampling_ratio/min": 0.09866492673754693,
"sampling/sampling_logp_difference/max": 0.9350365281105042,
"sampling/sampling_logp_difference/mean": 0.004486333788372576,
"step": 5220,
"step_time": 7.661558428985882
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1539.0,
"completions/max_terminated_length": 783.0,
"completions/mean_length": 156.89765625,
"completions/mean_terminated_length": 150.94947204589843,
"completions/min_length": 68.6,
"completions/min_terminated_length": 68.6,
"entropy": 0.045308487163856624,
"epoch": 11.19914346895075,
"frac_reward_zero_std": 0.8375,
"grad_norm": 1.4453125,
"learning_rate": 9.477100000000001e-06,
"loss": -0.0066,
"num_tokens": 553770400.0,
"reward": 1.061582052707672,
"reward_std": 0.17013634592294694,
"rewards/reward_accuracy/mean": 0.96171875,
"rewards/reward_accuracy/std": 0.16914646103978156,
"rewards/reward_format/mean": 0.09986328184604645,
"rewards/reward_format/std": 0.002187500172294676,
"sampling/importance_sampling_ratio/max": 2.5146281003952025,
"sampling/importance_sampling_ratio/mean": 0.9889275133609772,
"sampling/importance_sampling_ratio/min": 0.09889956787228585,
"sampling/sampling_logp_difference/max": 0.9780591130256653,
"sampling/sampling_logp_difference/mean": 0.004238821822218597,
"step": 5230,
"step_time": 7.068658238404896
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1297.3,
"completions/max_terminated_length": 1236.2,
"completions/mean_length": 161.213671875,
"completions/mean_terminated_length": 156.83724060058594,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"entropy": 0.050814986764453354,
"epoch": 11.220556745182012,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.24609375,
"learning_rate": 9.4761e-06,
"loss": -0.0057,
"num_tokens": 554699779.0,
"reward": 1.070117223262787,
"reward_std": 0.13633254319429397,
"rewards/reward_accuracy/mean": 0.9703125,
"rewards/reward_accuracy/std": 0.1352703295648098,
"rewards/reward_format/mean": 0.09980468973517417,
"rewards/reward_format/std": 0.0021583085414022206,
"sampling/importance_sampling_ratio/max": 2.414444899559021,
"sampling/importance_sampling_ratio/mean": 0.9922867059707642,
"sampling/importance_sampling_ratio/min": 0.13193062394857408,
"sampling/sampling_logp_difference/max": 0.8927584230899811,
"sampling/sampling_logp_difference/mean": 0.004148345207795501,
"step": 5240,
"step_time": 6.284514284081524
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0171875,
"completions/max_length": 1866.2,
"completions/max_terminated_length": 1755.4,
"completions/mean_length": 204.7484375,
"completions/mean_terminated_length": 172.70781555175782,
"completions/min_length": 66.5,
"completions/min_terminated_length": 66.5,
"entropy": 0.06793655371293425,
"epoch": 11.241970021413277,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.435546875,
"learning_rate": 9.4751e-06,
"loss": -0.0098,
"num_tokens": 555748159.0,
"reward": 1.0145117402076722,
"reward_std": 0.2693760097026825,
"rewards/reward_accuracy/mean": 0.916015625,
"rewards/reward_accuracy/std": 0.26506926864385605,
"rewards/reward_format/mean": 0.0984960950911045,
"rewards/reward_format/std": 0.008183709648437797,
"sampling/importance_sampling_ratio/max": 2.5453163623809814,
"sampling/importance_sampling_ratio/mean": 0.9786543309688568,
"sampling/importance_sampling_ratio/min": 0.059549680631607774,
"sampling/sampling_logp_difference/max": 1.2894904136657714,
"sampling/sampling_logp_difference/mean": 0.004793948400765658,
"step": 5250,
"step_time": 9.591153694005333
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1490.0,
"completions/max_terminated_length": 1188.4,
"completions/mean_length": 169.62109375,
"completions/mean_terminated_length": 162.37631378173828,
"completions/min_length": 65.6,
"completions/min_terminated_length": 65.6,
"entropy": 0.05480950819328427,
"epoch": 11.26338329764454,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.60546875,
"learning_rate": 9.474100000000001e-06,
"loss": -0.0023,
"num_tokens": 556701957.0,
"reward": 1.033593773841858,
"reward_std": 0.22479747906327247,
"rewards/reward_accuracy/mean": 0.933984375,
"rewards/reward_accuracy/std": 0.22363412156701087,
"rewards/reward_format/mean": 0.09960937574505806,
"rewards/reward_format/std": 0.0035222926177084445,
"sampling/importance_sampling_ratio/max": 2.3838871359825133,
"sampling/importance_sampling_ratio/mean": 0.9767265677452087,
"sampling/importance_sampling_ratio/min": 0.08907354865223169,
"sampling/sampling_logp_difference/max": 0.8409095525741577,
"sampling/sampling_logp_difference/mean": 0.0043980484129861,
"step": 5260,
"step_time": 7.172265021890053
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 959.7,
"completions/max_terminated_length": 882.9,
"completions/mean_length": 142.198046875,
"completions/mean_terminated_length": 138.49600219726562,
"completions/min_length": 61.9,
"completions/min_terminated_length": 61.9,
"entropy": 0.04358038746286184,
"epoch": 11.284796573875804,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.0,
"learning_rate": 9.4731e-06,
"loss": -0.002,
"num_tokens": 557571200.0,
"reward": 1.0600390911102295,
"reward_std": 0.1708349585533142,
"rewards/reward_accuracy/mean": 0.96015625,
"rewards/reward_accuracy/std": 0.17023815661668779,
"rewards/reward_format/mean": 0.09988281428813935,
"rewards/reward_format/std": 0.0015071487054228784,
"sampling/importance_sampling_ratio/max": 2.409239721298218,
"sampling/importance_sampling_ratio/mean": 0.9890744745731354,
"sampling/importance_sampling_ratio/min": 0.15358943343162537,
"sampling/sampling_logp_difference/max": 0.9679065704345703,
"sampling/sampling_logp_difference/mean": 0.004021324543282389,
"step": 5270,
"step_time": 4.6887014757929135
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1918.2,
"completions/max_terminated_length": 1621.1,
"completions/mean_length": 184.696484375,
"completions/mean_terminated_length": 176.7286018371582,
"completions/min_length": 63.5,
"completions/min_terminated_length": 63.5,
"entropy": 0.054545385646633804,
"epoch": 11.306209850107066,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.138671875,
"learning_rate": 9.4721e-06,
"loss": -0.0137,
"num_tokens": 558560071.0,
"reward": 1.0589453399181366,
"reward_std": 0.17827944383025168,
"rewards/reward_accuracy/mean": 0.959375,
"rewards/reward_accuracy/std": 0.17610670775175094,
"rewards/reward_format/mean": 0.09957031458616257,
"rewards/reward_format/std": 0.004832571931183338,
"sampling/importance_sampling_ratio/max": 2.53144166469574,
"sampling/importance_sampling_ratio/mean": 0.9925166547298432,
"sampling/importance_sampling_ratio/min": 0.10496765188872814,
"sampling/sampling_logp_difference/max": 0.9597858786582947,
"sampling/sampling_logp_difference/mean": 0.004316252027638257,
"step": 5280,
"step_time": 9.219464356204844
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.010546875,
"completions/max_length": 1438.9,
"completions/max_terminated_length": 1258.4,
"completions/mean_length": 185.259765625,
"completions/mean_terminated_length": 166.1289306640625,
"completions/min_length": 66.3,
"completions/min_terminated_length": 66.3,
"entropy": 0.060544363665394486,
"epoch": 11.32762312633833,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.0,
"learning_rate": 9.471100000000002e-06,
"loss": -0.0079,
"num_tokens": 559543728.0,
"reward": 1.0557226896286012,
"reward_std": 0.17660998329520225,
"rewards/reward_accuracy/mean": 0.956640625,
"rewards/reward_accuracy/std": 0.17310890406370164,
"rewards/reward_format/mean": 0.09908203333616257,
"rewards/reward_format/std": 0.0055952159687876705,
"sampling/importance_sampling_ratio/max": 2.4276714086532594,
"sampling/importance_sampling_ratio/mean": 0.9746297836303711,
"sampling/importance_sampling_ratio/min": 0.1343322854489088,
"sampling/sampling_logp_difference/max": 0.9084904432296753,
"sampling/sampling_logp_difference/mean": 0.004703112761490047,
"step": 5290,
"step_time": 7.32782853828976
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1544.5,
"completions/max_terminated_length": 1314.8,
"completions/mean_length": 176.209375,
"completions/mean_terminated_length": 160.96661987304688,
"completions/min_length": 68.2,
"completions/min_terminated_length": 68.2,
"entropy": 0.05729189794510603,
"epoch": 11.349036402569594,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.236328125,
"learning_rate": 9.470100000000001e-06,
"loss": -0.0028,
"num_tokens": 560510568.0,
"reward": 1.0421679973602296,
"reward_std": 0.19404015839099883,
"rewards/reward_accuracy/mean": 0.94296875,
"rewards/reward_accuracy/std": 0.19084297195076944,
"rewards/reward_format/mean": 0.09919921979308129,
"rewards/reward_format/std": 0.006549647054634988,
"sampling/importance_sampling_ratio/max": 2.563789355754852,
"sampling/importance_sampling_ratio/mean": 0.9803912997245788,
"sampling/importance_sampling_ratio/min": 0.11369948908686638,
"sampling/sampling_logp_difference/max": 1.1233096539974212,
"sampling/sampling_logp_difference/mean": 0.004607840511016548,
"step": 5300,
"step_time": 7.425988752691774
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1750.5,
"completions/max_terminated_length": 1691.3,
"completions/mean_length": 213.352734375,
"completions/mean_terminated_length": 193.38842163085937,
"completions/min_length": 72.1,
"completions/min_terminated_length": 72.1,
"entropy": 0.07226661224849522,
"epoch": 11.370449678800856,
"frac_reward_zero_std": 0.79375,
"grad_norm": 0.78125,
"learning_rate": 9.4691e-06,
"loss": -0.0055,
"num_tokens": 561580463.0,
"reward": 1.032324242591858,
"reward_std": 0.2308337815105915,
"rewards/reward_accuracy/mean": 0.933203125,
"rewards/reward_accuracy/std": 0.22816708758473397,
"rewards/reward_format/mean": 0.09912109524011611,
"rewards/reward_format/std": 0.006275810836814344,
"sampling/importance_sampling_ratio/max": 2.4734912872314454,
"sampling/importance_sampling_ratio/mean": 0.9717226922512054,
"sampling/importance_sampling_ratio/min": 0.03771335864439607,
"sampling/sampling_logp_difference/max": 0.8082320094108582,
"sampling/sampling_logp_difference/mean": 0.005098061310127378,
"step": 5310,
"step_time": 8.677178171192645
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1641.5,
"completions/max_terminated_length": 1264.6,
"completions/mean_length": 171.42421875,
"completions/mean_terminated_length": 163.41295776367187,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.05415123070124537,
"epoch": 11.39186295503212,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.80859375,
"learning_rate": 9.468100000000002e-06,
"loss": -0.0049,
"num_tokens": 562529469.0,
"reward": 1.0577343940734862,
"reward_std": 0.15350728780031203,
"rewards/reward_accuracy/mean": 0.958203125,
"rewards/reward_accuracy/std": 0.1510814607143402,
"rewards/reward_format/mean": 0.0995312511920929,
"rewards/reward_format/std": 0.0052109131356701255,
"sampling/importance_sampling_ratio/max": 2.4866978406906126,
"sampling/importance_sampling_ratio/mean": 0.9834004044532776,
"sampling/importance_sampling_ratio/min": 0.08746480718255042,
"sampling/sampling_logp_difference/max": 0.8656875312328338,
"sampling/sampling_logp_difference/mean": 0.004360417718999088,
"step": 5320,
"step_time": 8.037146555099753
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1522.0,
"completions/max_terminated_length": 1310.3,
"completions/mean_length": 171.736328125,
"completions/mean_terminated_length": 162.94429931640624,
"completions/min_length": 67.8,
"completions/min_terminated_length": 67.8,
"entropy": 0.054042431083507834,
"epoch": 11.413276231263383,
"frac_reward_zero_std": 0.83125,
"grad_norm": 0.42578125,
"learning_rate": 9.467100000000001e-06,
"loss": -0.0106,
"num_tokens": 563484234.0,
"reward": 1.052246105670929,
"reward_std": 0.1972512759268284,
"rewards/reward_accuracy/mean": 0.952734375,
"rewards/reward_accuracy/std": 0.19574617519974707,
"rewards/reward_format/mean": 0.09951171949505806,
"rewards/reward_format/std": 0.004323652293533087,
"sampling/importance_sampling_ratio/max": 2.5100038766860964,
"sampling/importance_sampling_ratio/mean": 0.9745616257190705,
"sampling/importance_sampling_ratio/min": 0.05476651638746262,
"sampling/sampling_logp_difference/max": 0.9220221638679504,
"sampling/sampling_logp_difference/mean": 0.00448452727869153,
"step": 5330,
"step_time": 7.361234192593838
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1812.8,
"completions/max_terminated_length": 1720.8,
"completions/mean_length": 184.16953125,
"completions/mean_terminated_length": 171.2229019165039,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"entropy": 0.059212718065828084,
"epoch": 11.434689507494646,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.5,
"learning_rate": 9.4661e-06,
"loss": -0.0061,
"num_tokens": 564473532.0,
"reward": 1.0337500154972077,
"reward_std": 0.2317127503454685,
"rewards/reward_accuracy/mean": 0.934375,
"rewards/reward_accuracy/std": 0.2297601468861103,
"rewards/reward_format/mean": 0.09937500134110451,
"rewards/reward_format/std": 0.004934750241227448,
"sampling/importance_sampling_ratio/max": 2.352387571334839,
"sampling/importance_sampling_ratio/mean": 0.9762946128845215,
"sampling/importance_sampling_ratio/min": 0.10552137382328511,
"sampling/sampling_logp_difference/max": 0.8731565952301026,
"sampling/sampling_logp_difference/mean": 0.004669048334471881,
"step": 5340,
"step_time": 8.798201813400373
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1631.3,
"completions/max_terminated_length": 1425.9,
"completions/mean_length": 169.453515625,
"completions/mean_terminated_length": 155.50780639648437,
"completions/min_length": 62.0,
"completions/min_terminated_length": 62.0,
"entropy": 0.05299694295972586,
"epoch": 11.45610278372591,
"frac_reward_zero_std": 0.85625,
"grad_norm": 1.234375,
"learning_rate": 9.4651e-06,
"loss": -0.0053,
"num_tokens": 565422581.0,
"reward": 1.0605859518051148,
"reward_std": 0.19059524759650232,
"rewards/reward_accuracy/mean": 0.961328125,
"rewards/reward_accuracy/std": 0.18705111294984816,
"rewards/reward_format/mean": 0.09925781339406967,
"rewards/reward_format/std": 0.005742412526160479,
"sampling/importance_sampling_ratio/max": 2.5340433597564695,
"sampling/importance_sampling_ratio/mean": 0.9949930608272552,
"sampling/importance_sampling_ratio/min": 0.10530232526361942,
"sampling/sampling_logp_difference/max": 1.172405469417572,
"sampling/sampling_logp_difference/mean": 0.0043753654230386015,
"step": 5350,
"step_time": 8.013957288308301
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.494976913818391e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.494976913818391e-06,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1729.0,
"completions/max_terminated_length": 1494.8,
"completions/mean_length": 175.932421875,
"completions/mean_terminated_length": 161.3014694213867,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.05889112739823758,
"epoch": 11.477516059957173,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.0,
"learning_rate": 9.4641e-06,
"loss": -0.0053,
"num_tokens": 566388440.0,
"reward": 1.047050791978836,
"reward_std": 0.18893018439412118,
"rewards/reward_accuracy/mean": 0.94765625,
"rewards/reward_accuracy/std": 0.18705590665340424,
"rewards/reward_format/mean": 0.09939453229308129,
"rewards/reward_format/std": 0.0055356772616505625,
"sampling/importance_sampling_ratio/max": 2.5055844306945803,
"sampling/importance_sampling_ratio/mean": 0.9924162447452545,
"sampling/importance_sampling_ratio/min": 0.1401386771351099,
"sampling/sampling_logp_difference/max": 0.9062417864799499,
"sampling/sampling_logp_difference/mean": 0.004647717205807566,
"step": 5360,
"step_time": 8.155308975104708
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1420.2,
"completions/max_terminated_length": 1225.8,
"completions/mean_length": 168.21015625,
"completions/mean_terminated_length": 157.966748046875,
"completions/min_length": 61.0,
"completions/min_terminated_length": 61.0,
"entropy": 0.05220930436626077,
"epoch": 11.498929336188437,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.9375,
"learning_rate": 9.463100000000001e-06,
"loss": 0.0014,
"num_tokens": 567332226.0,
"reward": 1.032500022649765,
"reward_std": 0.22379263639450073,
"rewards/reward_accuracy/mean": 0.9328125,
"rewards/reward_accuracy/std": 0.22272489964962006,
"rewards/reward_format/mean": 0.09968750178813934,
"rewards/reward_format/std": 0.003524223598651588,
"sampling/importance_sampling_ratio/max": 2.3726468086242676,
"sampling/importance_sampling_ratio/mean": 0.9701983749866485,
"sampling/importance_sampling_ratio/min": 0.09939235523343086,
"sampling/sampling_logp_difference/max": 1.062865948677063,
"sampling/sampling_logp_difference/mean": 0.0043634033994749185,
"step": 5370,
"step_time": 7.109382184009883
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1774.1,
"completions/max_terminated_length": 1480.7,
"completions/mean_length": 180.8359375,
"completions/mean_terminated_length": 176.46194152832032,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.06287550271954387,
"epoch": 11.5203426124197,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.1826171875,
"learning_rate": 9.4621e-06,
"loss": -0.0154,
"num_tokens": 568317534.0,
"reward": 1.0458398520946504,
"reward_std": 0.19698601216077805,
"rewards/reward_accuracy/mean": 0.94609375,
"rewards/reward_accuracy/std": 0.19574195742607117,
"rewards/reward_format/mean": 0.09974609389901161,
"rewards/reward_format/std": 0.003480213647708297,
"sampling/importance_sampling_ratio/max": 2.57554669380188,
"sampling/importance_sampling_ratio/mean": 0.9857352077960968,
"sampling/importance_sampling_ratio/min": 0.10488540530204774,
"sampling/sampling_logp_difference/max": 1.037378764152527,
"sampling/sampling_logp_difference/mean": 0.004797182139009237,
"step": 5380,
"step_time": 8.47470591858728
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1570.0,
"completions/max_terminated_length": 1246.8,
"completions/mean_length": 177.21796875,
"completions/mean_terminated_length": 167.78542938232422,
"completions/min_length": 74.0,
"completions/min_terminated_length": 74.0,
"entropy": 0.05995953436940908,
"epoch": 11.541755888650963,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.34765625,
"learning_rate": 9.461100000000002e-06,
"loss": -0.0074,
"num_tokens": 569287964.0,
"reward": 1.0371093988418578,
"reward_std": 0.21677694842219353,
"rewards/reward_accuracy/mean": 0.9375,
"rewards/reward_accuracy/std": 0.21538259088993073,
"rewards/reward_format/mean": 0.09960937723517418,
"rewards/reward_format/std": 0.004598386911675334,
"sampling/importance_sampling_ratio/max": 2.480675482749939,
"sampling/importance_sampling_ratio/mean": 0.9769798636436462,
"sampling/importance_sampling_ratio/min": 0.09574082642793655,
"sampling/sampling_logp_difference/max": 1.0349814355373383,
"sampling/sampling_logp_difference/mean": 0.004789444757625461,
"step": 5390,
"step_time": 7.6199145523074545
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.1444091796875e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.1444091796875e-06,
"completions/clipped_ratio": 0.019140625,
"completions/max_length": 1988.5,
"completions/max_terminated_length": 1691.7,
"completions/mean_length": 224.709375,
"completions/mean_terminated_length": 189.79188842773436,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.07739067380316556,
"epoch": 11.563169164882227,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.28515625,
"learning_rate": 9.460100000000001e-06,
"loss": 0.0011,
"num_tokens": 570383588.0,
"reward": 1.030839866399765,
"reward_std": 0.22420699894428253,
"rewards/reward_accuracy/mean": 0.932421875,
"rewards/reward_accuracy/std": 0.2192845053970814,
"rewards/reward_format/mean": 0.09841797053813935,
"rewards/reward_format/std": 0.008944371365942061,
"sampling/importance_sampling_ratio/max": 2.6182291984558104,
"sampling/importance_sampling_ratio/mean": 0.9697023510932923,
"sampling/importance_sampling_ratio/min": 0.003215079545043409,
"sampling/sampling_logp_difference/max": 1.031662654876709,
"sampling/sampling_logp_difference/mean": 0.0051609529880806805,
"step": 5400,
"step_time": 10.15187937351293
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1626.3,
"completions/max_terminated_length": 1394.4,
"completions/mean_length": 190.216015625,
"completions/mean_terminated_length": 172.82107543945312,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.06093245351221412,
"epoch": 11.58458244111349,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.67578125,
"learning_rate": 9.4591e-06,
"loss": -0.0087,
"num_tokens": 571388653.0,
"reward": 1.047460961341858,
"reward_std": 0.2081266723573208,
"rewards/reward_accuracy/mean": 0.9484375,
"rewards/reward_accuracy/std": 0.20465268045663834,
"rewards/reward_format/mean": 0.09902343899011612,
"rewards/reward_format/std": 0.006702065002173185,
"sampling/importance_sampling_ratio/max": 2.4319849729537966,
"sampling/importance_sampling_ratio/mean": 0.9813357055187225,
"sampling/importance_sampling_ratio/min": 0.1023970540612936,
"sampling/sampling_logp_difference/max": 1.1461209177970886,
"sampling/sampling_logp_difference/mean": 0.004550757887773216,
"step": 5410,
"step_time": 8.007879570417572
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 1999.1,
"completions/max_terminated_length": 1623.5,
"completions/mean_length": 190.173046875,
"completions/mean_terminated_length": 168.26591033935546,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.07052513151429593,
"epoch": 11.605995717344754,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.291015625,
"learning_rate": 9.458100000000002e-06,
"loss": -0.0097,
"num_tokens": 572390712.0,
"reward": 1.0466797053813934,
"reward_std": 0.209648285061121,
"rewards/reward_accuracy/mean": 0.94765625,
"rewards/reward_accuracy/std": 0.2055061213672161,
"rewards/reward_format/mean": 0.09902343824505806,
"rewards/reward_format/std": 0.007761914562433958,
"sampling/importance_sampling_ratio/max": 2.4941864967346192,
"sampling/importance_sampling_ratio/mean": 0.9648529529571533,
"sampling/importance_sampling_ratio/min": 0.047953236103057864,
"sampling/sampling_logp_difference/max": 0.9334433555603028,
"sampling/sampling_logp_difference/mean": 0.004996118624694646,
"step": 5420,
"step_time": 9.511264996393583
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1655.1,
"completions/max_terminated_length": 1416.9,
"completions/mean_length": 182.2421875,
"completions/mean_terminated_length": 165.62183532714843,
"completions/min_length": 69.5,
"completions/min_terminated_length": 69.5,
"entropy": 0.057917721755802634,
"epoch": 11.627408993576017,
"frac_reward_zero_std": 0.83125,
"grad_norm": 1.0703125,
"learning_rate": 9.457100000000001e-06,
"loss": -0.0017,
"num_tokens": 573376276.0,
"reward": 1.0381640911102294,
"reward_std": 0.21446372494101523,
"rewards/reward_accuracy/mean": 0.9390625,
"rewards/reward_accuracy/std": 0.2116647854447365,
"rewards/reward_format/mean": 0.09910156428813935,
"rewards/reward_format/std": 0.0056836498901247975,
"sampling/importance_sampling_ratio/max": 2.509683918952942,
"sampling/importance_sampling_ratio/mean": 0.9843315005302429,
"sampling/importance_sampling_ratio/min": 0.06937746722251177,
"sampling/sampling_logp_difference/max": 0.79686079621315,
"sampling/sampling_logp_difference/mean": 0.004715158930048346,
"step": 5430,
"step_time": 8.01404344929033
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1808.8,
"completions/max_terminated_length": 1544.8,
"completions/mean_length": 184.6234375,
"completions/mean_terminated_length": 176.62430725097656,
"completions/min_length": 63.7,
"completions/min_terminated_length": 63.7,
"entropy": 0.06536171636544168,
"epoch": 11.64882226980728,
"frac_reward_zero_std": 0.8125,
"grad_norm": 0.9140625,
"learning_rate": 9.4561e-06,
"loss": -0.0033,
"num_tokens": 574370400.0,
"reward": 1.0351172268390656,
"reward_std": 0.22902742624282837,
"rewards/reward_accuracy/mean": 0.935546875,
"rewards/reward_accuracy/std": 0.22756540030241013,
"rewards/reward_format/mean": 0.09957031533122063,
"rewards/reward_format/std": 0.004639781382866204,
"sampling/importance_sampling_ratio/max": 2.703585910797119,
"sampling/importance_sampling_ratio/mean": 0.9853502154350281,
"sampling/importance_sampling_ratio/min": 0.02280167117714882,
"sampling/sampling_logp_difference/max": 1.152755182981491,
"sampling/sampling_logp_difference/mean": 0.005119440401904285,
"step": 5440,
"step_time": 8.398188020422822
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1563.7,
"completions/max_terminated_length": 1330.6,
"completions/mean_length": 186.773828125,
"completions/mean_terminated_length": 173.90175170898436,
"completions/min_length": 67.4,
"completions/min_terminated_length": 67.4,
"entropy": 0.06404700328130275,
"epoch": 11.670235546038544,
"frac_reward_zero_std": 0.8375,
"grad_norm": 1.0390625,
"learning_rate": 9.4551e-06,
"loss": -0.0059,
"num_tokens": 575363949.0,
"reward": 1.0672070384025574,
"reward_std": 0.14380362033843994,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.14081485643982888,
"rewards/reward_format/mean": 0.09923828318715096,
"rewards/reward_format/std": 0.005747591052204371,
"sampling/importance_sampling_ratio/max": 2.385467195510864,
"sampling/importance_sampling_ratio/mean": 0.9764528632164001,
"sampling/importance_sampling_ratio/min": 0.1276267245411873,
"sampling/sampling_logp_difference/max": 1.0859193742275237,
"sampling/sampling_logp_difference/mean": 0.004878942295908928,
"step": 5450,
"step_time": 7.683173120487481
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 1664.3,
"completions/max_terminated_length": 1495.1,
"completions/mean_length": 213.473046875,
"completions/mean_terminated_length": 192.06815643310546,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.07292865007184446,
"epoch": 11.691648822269807,
"frac_reward_zero_std": 0.8125,
"grad_norm": 0.58984375,
"learning_rate": 9.4541e-06,
"loss": -0.0243,
"num_tokens": 576434872.0,
"reward": 1.0319336116313935,
"reward_std": 0.22814005613327026,
"rewards/reward_accuracy/mean": 0.9328125,
"rewards/reward_accuracy/std": 0.22537462860345842,
"rewards/reward_format/mean": 0.09912109449505806,
"rewards/reward_format/std": 0.006894739111885428,
"sampling/importance_sampling_ratio/max": 2.5744168639183043,
"sampling/importance_sampling_ratio/mean": 0.9789920389652252,
"sampling/importance_sampling_ratio/min": 0.07137143090367318,
"sampling/sampling_logp_difference/max": 0.9534370183944703,
"sampling/sampling_logp_difference/mean": 0.005040205735713244,
"step": 5460,
"step_time": 8.35780284528737
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 1985.5,
"completions/max_terminated_length": 1849.3,
"completions/mean_length": 197.044140625,
"completions/mean_terminated_length": 175.23011932373046,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.07087927646934986,
"epoch": 11.713062098501071,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.2265625,
"learning_rate": 9.453100000000001e-06,
"loss": -0.0174,
"num_tokens": 577458617.0,
"reward": 1.0328906416893004,
"reward_std": 0.24208325892686844,
"rewards/reward_accuracy/mean": 0.933984375,
"rewards/reward_accuracy/std": 0.2376169130206108,
"rewards/reward_format/mean": 0.09890625178813935,
"rewards/reward_format/std": 0.008191753481514751,
"sampling/importance_sampling_ratio/max": 2.4512992978096007,
"sampling/importance_sampling_ratio/mean": 0.9793515622615814,
"sampling/importance_sampling_ratio/min": 0.03216953934170306,
"sampling/sampling_logp_difference/max": 0.8732777953147888,
"sampling/sampling_logp_difference/mean": 0.005114543065428734,
"step": 5470,
"step_time": 9.427058506591129
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01328125,
"completions/max_length": 1933.1,
"completions/max_terminated_length": 1690.3,
"completions/mean_length": 189.66796875,
"completions/mean_terminated_length": 164.73313751220704,
"completions/min_length": 62.9,
"completions/min_terminated_length": 62.9,
"entropy": 0.06849601750727743,
"epoch": 11.734475374732334,
"frac_reward_zero_std": 0.81875,
"grad_norm": 1.5625,
"learning_rate": 9.4521e-06,
"loss": -0.012,
"num_tokens": 578462919.0,
"reward": 1.0467968940734864,
"reward_std": 0.20838939473032952,
"rewards/reward_accuracy/mean": 0.94765625,
"rewards/reward_accuracy/std": 0.20493818297982216,
"rewards/reward_format/mean": 0.09914062619209289,
"rewards/reward_format/std": 0.00750048547051847,
"sampling/importance_sampling_ratio/max": 2.5063945055007935,
"sampling/importance_sampling_ratio/mean": 0.9852425396442414,
"sampling/importance_sampling_ratio/min": 0.012690242659300566,
"sampling/sampling_logp_difference/max": 0.8750132203102112,
"sampling/sampling_logp_difference/mean": 0.005100026493892074,
"step": 5480,
"step_time": 9.23580350188422
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 9.969150141841964e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 9.969150141841964e-07,
"completions/clipped_ratio": 0.012890625,
"completions/max_length": 1623.4,
"completions/max_terminated_length": 1441.1,
"completions/mean_length": 194.415625,
"completions/mean_terminated_length": 170.5663619995117,
"completions/min_length": 70.3,
"completions/min_terminated_length": 70.3,
"entropy": 0.05967251220718026,
"epoch": 11.755888650963598,
"frac_reward_zero_std": 0.81875,
"grad_norm": 2.71875,
"learning_rate": 9.4511e-06,
"loss": -0.006,
"num_tokens": 579479071.0,
"reward": 1.0310742557048798,
"reward_std": 0.21503591984510423,
"rewards/reward_accuracy/mean": 0.932421875,
"rewards/reward_accuracy/std": 0.210786372423172,
"rewards/reward_format/mean": 0.09865234494209289,
"rewards/reward_format/std": 0.008206942304968833,
"sampling/importance_sampling_ratio/max": 2.585648465156555,
"sampling/importance_sampling_ratio/mean": 0.9784492969512939,
"sampling/importance_sampling_ratio/min": 0.11250863205641508,
"sampling/sampling_logp_difference/max": 1.0512039065361023,
"sampling/sampling_logp_difference/mean": 0.004563816520385444,
"step": 5490,
"step_time": 8.073261754808481
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1651.0,
"completions/max_terminated_length": 1480.1,
"completions/mean_length": 190.634765625,
"completions/mean_terminated_length": 171.83755950927736,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.060199832124635574,
"epoch": 11.777301927194861,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.0,
"learning_rate": 9.450100000000001e-06,
"loss": 0.0007,
"num_tokens": 580483320.0,
"reward": 1.0545703291893005,
"reward_std": 0.1615181103348732,
"rewards/reward_accuracy/mean": 0.95546875,
"rewards/reward_accuracy/std": 0.15816218852996827,
"rewards/reward_format/mean": 0.09910156354308128,
"rewards/reward_format/std": 0.006745753576979041,
"sampling/importance_sampling_ratio/max": 2.5767147302627564,
"sampling/importance_sampling_ratio/mean": 0.9825194656848908,
"sampling/importance_sampling_ratio/min": 0.11496560331434011,
"sampling/sampling_logp_difference/max": 1.2277524828910829,
"sampling/sampling_logp_difference/mean": 0.004694106103852391,
"step": 5500,
"step_time": 7.9552341286762385
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1840.7,
"completions/max_terminated_length": 1554.2,
"completions/mean_length": 189.735546875,
"completions/mean_terminated_length": 174.47580261230468,
"completions/min_length": 59.7,
"completions/min_terminated_length": 59.7,
"entropy": 0.07010595770552755,
"epoch": 11.798715203426124,
"frac_reward_zero_std": 0.83125,
"grad_norm": 0.50390625,
"learning_rate": 9.4491e-06,
"loss": -0.0119,
"num_tokens": 581490899.0,
"reward": 1.042089867591858,
"reward_std": 0.20363333746790885,
"rewards/reward_accuracy/mean": 0.942578125,
"rewards/reward_accuracy/std": 0.20191937312483788,
"rewards/reward_format/mean": 0.09951172098517418,
"rewards/reward_format/std": 0.004633177001960575,
"sampling/importance_sampling_ratio/max": 2.5247421503067016,
"sampling/importance_sampling_ratio/mean": 0.9764230847358704,
"sampling/importance_sampling_ratio/min": 0.08448497094213962,
"sampling/sampling_logp_difference/max": 1.0069595217704772,
"sampling/sampling_logp_difference/mean": 0.005051067983731628,
"step": 5510,
"step_time": 8.818693970004096
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1401.7,
"completions/max_terminated_length": 1262.7,
"completions/mean_length": 160.196875,
"completions/mean_terminated_length": 151.42781524658204,
"completions/min_length": 63.7,
"completions/min_terminated_length": 63.7,
"entropy": 0.054643613868393004,
"epoch": 11.820128479657388,
"frac_reward_zero_std": 0.84375,
"grad_norm": 0.0,
"learning_rate": 9.448100000000002e-06,
"loss": -0.0045,
"num_tokens": 582412859.0,
"reward": 1.0494336009025573,
"reward_std": 0.18813522458076476,
"rewards/reward_accuracy/mean": 0.95,
"rewards/reward_accuracy/std": 0.18643821999430657,
"rewards/reward_format/mean": 0.09943359419703483,
"rewards/reward_format/std": 0.005220264568924904,
"sampling/importance_sampling_ratio/max": 2.4412820816040037,
"sampling/importance_sampling_ratio/mean": 0.9870848834514618,
"sampling/importance_sampling_ratio/min": 0.09356680512428284,
"sampling/sampling_logp_difference/max": 0.9398293673992157,
"sampling/sampling_logp_difference/mean": 0.004727907944470644,
"step": 5520,
"step_time": 6.71868340759247
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1682.9,
"completions/max_terminated_length": 1501.1,
"completions/mean_length": 193.509765625,
"completions/mean_terminated_length": 175.24764251708984,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"entropy": 0.056438761902973054,
"epoch": 11.84154175588865,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.640625,
"learning_rate": 9.447100000000001e-06,
"loss": -0.0049,
"num_tokens": 583431780.0,
"reward": 1.0483984708786012,
"reward_std": 0.19721727147698404,
"rewards/reward_accuracy/mean": 0.94921875,
"rewards/reward_accuracy/std": 0.19439878836274146,
"rewards/reward_format/mean": 0.09917968958616256,
"rewards/reward_format/std": 0.005512544303201139,
"sampling/importance_sampling_ratio/max": 2.664142942428589,
"sampling/importance_sampling_ratio/mean": 0.9873600959777832,
"sampling/importance_sampling_ratio/min": 0.16994923651218413,
"sampling/sampling_logp_difference/max": 0.8929296135902405,
"sampling/sampling_logp_difference/mean": 0.004304657666943967,
"step": 5530,
"step_time": 8.205905658414121
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1783.4,
"completions/max_terminated_length": 1536.2,
"completions/mean_length": 200.3,
"completions/mean_terminated_length": 180.31382598876954,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.06443554039578885,
"epoch": 11.862955032119915,
"frac_reward_zero_std": 0.84375,
"grad_norm": 0.0,
"learning_rate": 9.446100000000001e-06,
"loss": -0.0138,
"num_tokens": 584460372.0,
"reward": 1.0354296922683717,
"reward_std": 0.21718773245811462,
"rewards/reward_accuracy/mean": 0.936328125,
"rewards/reward_accuracy/std": 0.21423292085528373,
"rewards/reward_format/mean": 0.09910156354308128,
"rewards/reward_format/std": 0.007341027329675853,
"sampling/importance_sampling_ratio/max": 2.5866408705711366,
"sampling/importance_sampling_ratio/mean": 0.9852359652519226,
"sampling/importance_sampling_ratio/min": 0.032890576869249344,
"sampling/sampling_logp_difference/max": 0.8974310040473938,
"sampling/sampling_logp_difference/mean": 0.004658846370875836,
"step": 5540,
"step_time": 8.8195088175009
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.33514404296875e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.33514404296875e-06,
"completions/clipped_ratio": 0.01875,
"completions/max_length": 1879.8,
"completions/max_terminated_length": 1665.0,
"completions/mean_length": 216.955859375,
"completions/mean_terminated_length": 182.02007598876952,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.06396469618193805,
"epoch": 11.884368308351178,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.388671875,
"learning_rate": 9.4451e-06,
"loss": -0.0116,
"num_tokens": 585536275.0,
"reward": 1.0248437821865082,
"reward_std": 0.26135039180517194,
"rewards/reward_accuracy/mean": 0.9265625,
"rewards/reward_accuracy/std": 0.2554875031113625,
"rewards/reward_format/mean": 0.09828125089406967,
"rewards/reward_format/std": 0.009174523083493114,
"sampling/importance_sampling_ratio/max": 2.572258174419403,
"sampling/importance_sampling_ratio/mean": 0.9775561273097992,
"sampling/importance_sampling_ratio/min": 0.06312136929482222,
"sampling/sampling_logp_difference/max": 1.1480861067771913,
"sampling/sampling_logp_difference/mean": 0.004573788749985397,
"step": 5550,
"step_time": 9.387863489595475
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 9.193335927193402e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 9.193335927193402e-07,
"completions/clipped_ratio": 0.015234375,
"completions/max_length": 1932.7,
"completions/max_terminated_length": 1660.9,
"completions/mean_length": 223.676171875,
"completions/mean_terminated_length": 195.53716430664062,
"completions/min_length": 69.4,
"completions/min_terminated_length": 69.4,
"entropy": 0.06958718081004918,
"epoch": 11.90578158458244,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.546875,
"learning_rate": 9.4441e-06,
"loss": -0.0084,
"num_tokens": 586633686.0,
"reward": 1.013574230670929,
"reward_std": 0.276006868481636,
"rewards/reward_accuracy/mean": 0.91484375,
"rewards/reward_accuracy/std": 0.2718340829014778,
"rewards/reward_format/mean": 0.09873046949505807,
"rewards/reward_format/std": 0.009248075680807233,
"sampling/importance_sampling_ratio/max": 2.600999140739441,
"sampling/importance_sampling_ratio/mean": 0.9809641599655151,
"sampling/importance_sampling_ratio/min": 0.037411945313215254,
"sampling/sampling_logp_difference/max": 1.140676534175873,
"sampling/sampling_logp_difference/mean": 0.004869699850678444,
"step": 5560,
"step_time": 9.552658818211057
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1556.3,
"completions/max_terminated_length": 1419.6,
"completions/mean_length": 190.95078125,
"completions/mean_terminated_length": 176.1225784301758,
"completions/min_length": 64.7,
"completions/min_terminated_length": 64.7,
"entropy": 0.060074614570476116,
"epoch": 11.927194860813705,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.314453125,
"learning_rate": 9.443100000000001e-06,
"loss": -0.0065,
"num_tokens": 587644648.0,
"reward": 1.0466992497444152,
"reward_std": 0.19442919120192528,
"rewards/reward_accuracy/mean": 0.947265625,
"rewards/reward_accuracy/std": 0.19249635711312293,
"rewards/reward_format/mean": 0.09943359568715096,
"rewards/reward_format/std": 0.0046183614060282705,
"sampling/importance_sampling_ratio/max": 2.4774898171424864,
"sampling/importance_sampling_ratio/mean": 0.9757066607475281,
"sampling/importance_sampling_ratio/min": 0.09586697854101658,
"sampling/sampling_logp_difference/max": 1.0411533057689666,
"sampling/sampling_logp_difference/mean": 0.004515099595300854,
"step": 5570,
"step_time": 7.624538310506614
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.369597541473922e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.369597541473922e-06,
"completions/clipped_ratio": 0.0140625,
"completions/max_length": 1812.9,
"completions/max_terminated_length": 1715.0,
"completions/mean_length": 197.086328125,
"completions/mean_terminated_length": 170.90281982421874,
"completions/min_length": 70.5,
"completions/min_terminated_length": 70.5,
"entropy": 0.06811431653331965,
"epoch": 11.948608137044967,
"frac_reward_zero_std": 0.83125,
"grad_norm": 0.263671875,
"learning_rate": 9.4421e-06,
"loss": -0.0067,
"num_tokens": 588662853.0,
"reward": 1.0453711211681367,
"reward_std": 0.20973512530326843,
"rewards/reward_accuracy/mean": 0.946484375,
"rewards/reward_accuracy/std": 0.20587852969765663,
"rewards/reward_format/mean": 0.09888672083616257,
"rewards/reward_format/std": 0.006947586126625538,
"sampling/importance_sampling_ratio/max": 2.574594259262085,
"sampling/importance_sampling_ratio/mean": 0.9769493043422699,
"sampling/importance_sampling_ratio/min": 0.01482144445180893,
"sampling/sampling_logp_difference/max": 1.0263651490211487,
"sampling/sampling_logp_difference/mean": 0.004857980320230127,
"step": 5580,
"step_time": 9.02198686519696
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1457.8,
"completions/max_terminated_length": 1209.0,
"completions/mean_length": 158.019921875,
"completions/mean_terminated_length": 153.5994674682617,
"completions/min_length": 65.6,
"completions/min_terminated_length": 65.6,
"entropy": 0.0521119543351233,
"epoch": 11.970021413276232,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.0,
"learning_rate": 9.4411e-06,
"loss": -0.0058,
"num_tokens": 589583976.0,
"reward": 1.0580273628234864,
"reward_std": 0.17496758475899696,
"rewards/reward_accuracy/mean": 0.958203125,
"rewards/reward_accuracy/std": 0.17440778464078904,
"rewards/reward_format/mean": 0.0998242199420929,
"rewards/reward_format/std": 0.0021842264104634523,
"sampling/importance_sampling_ratio/max": 2.451307773590088,
"sampling/importance_sampling_ratio/mean": 0.9871212244033813,
"sampling/importance_sampling_ratio/min": 0.0695611771196127,
"sampling/sampling_logp_difference/max": 0.8206144630908966,
"sampling/sampling_logp_difference/mean": 0.004489977820776403,
"step": 5590,
"step_time": 6.867607473497628
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1624.2,
"completions/max_terminated_length": 1405.2,
"completions/mean_length": 180.646875,
"completions/mean_terminated_length": 168.21638031005858,
"completions/min_length": 68.8,
"completions/min_terminated_length": 68.8,
"entropy": 0.057681117486208675,
"epoch": 11.991434689507495,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.494140625,
"learning_rate": 9.440100000000001e-06,
"loss": -0.0049,
"num_tokens": 590568000.0,
"reward": 1.0497851967811584,
"reward_std": 0.20037014335393905,
"rewards/reward_accuracy/mean": 0.950390625,
"rewards/reward_accuracy/std": 0.197579575330019,
"rewards/reward_format/mean": 0.09939453303813935,
"rewards/reward_format/std": 0.00568446209654212,
"sampling/importance_sampling_ratio/max": 2.6621317863464355,
"sampling/importance_sampling_ratio/mean": 0.9825070977210999,
"sampling/importance_sampling_ratio/min": 0.057515504956245425,
"sampling/sampling_logp_difference/max": 0.7536380648612976,
"sampling/sampling_logp_difference/mean": 0.004566601430997253,
"step": 5600,
"step_time": 7.999715754616773
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012109375,
"completions/max_length": 1845.6,
"completions/max_terminated_length": 1674.0,
"completions/mean_length": 205.550390625,
"completions/mean_terminated_length": 183.20128631591797,
"completions/min_length": 69.4,
"completions/min_terminated_length": 69.4,
"entropy": 0.07237428333610296,
"epoch": 12.012847965738757,
"frac_reward_zero_std": 0.84375,
"grad_norm": 0.55859375,
"learning_rate": 9.4391e-06,
"loss": -0.0061,
"num_tokens": 591621137.0,
"reward": 1.0325781464576722,
"reward_std": 0.2117878518998623,
"rewards/reward_accuracy/mean": 0.93359375,
"rewards/reward_accuracy/std": 0.2087746173143387,
"rewards/reward_format/mean": 0.09898437410593033,
"rewards/reward_format/std": 0.007553870789706707,
"sampling/importance_sampling_ratio/max": 2.4956231832504274,
"sampling/importance_sampling_ratio/mean": 0.987310266494751,
"sampling/importance_sampling_ratio/min": 0.06509240493178367,
"sampling/sampling_logp_difference/max": 1.1853888988494874,
"sampling/sampling_logp_difference/mean": 0.005210683168843389,
"step": 5610,
"step_time": 9.124832445997162
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1517.1,
"completions/max_terminated_length": 1395.9,
"completions/mean_length": 172.725,
"completions/mean_terminated_length": 169.115966796875,
"completions/min_length": 68.1,
"completions/min_terminated_length": 68.1,
"entropy": 0.054359806678257884,
"epoch": 12.034261241970022,
"frac_reward_zero_std": 0.84375,
"grad_norm": 0.67578125,
"learning_rate": 9.4381e-06,
"loss": -0.0041,
"num_tokens": 592581633.0,
"reward": 1.0408203244209289,
"reward_std": 0.18909812271595,
"rewards/reward_accuracy/mean": 0.941015625,
"rewards/reward_accuracy/std": 0.18825225606560708,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.002233161125332117,
"sampling/importance_sampling_ratio/max": 2.551731300354004,
"sampling/importance_sampling_ratio/mean": 0.9960304498672485,
"sampling/importance_sampling_ratio/min": 0.17471383437514304,
"sampling/sampling_logp_difference/max": 0.9732666134834289,
"sampling/sampling_logp_difference/mean": 0.00433277131523937,
"step": 5620,
"step_time": 7.143491389410338
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01796875,
"completions/max_length": 1715.1,
"completions/max_terminated_length": 1500.9,
"completions/mean_length": 201.341796875,
"completions/mean_terminated_length": 167.5024627685547,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.06937180263921619,
"epoch": 12.055674518201284,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.75,
"learning_rate": 9.437100000000002e-06,
"loss": -0.0014,
"num_tokens": 593610508.0,
"reward": 1.0298437893390655,
"reward_std": 0.23462080210447311,
"rewards/reward_accuracy/mean": 0.93125,
"rewards/reward_accuracy/std": 0.23057931140065194,
"rewards/reward_format/mean": 0.09859375208616257,
"rewards/reward_format/std": 0.008073431183584034,
"sampling/importance_sampling_ratio/max": 2.7600570917129517,
"sampling/importance_sampling_ratio/mean": 0.980850201845169,
"sampling/importance_sampling_ratio/min": 0.054947030683979395,
"sampling/sampling_logp_difference/max": 0.9557391285896302,
"sampling/sampling_logp_difference/mean": 0.004939295072108507,
"step": 5630,
"step_time": 8.616616642003645
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1433.6,
"completions/max_terminated_length": 1286.4,
"completions/mean_length": 178.218359375,
"completions/mean_terminated_length": 164.55789947509766,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.05529326309915632,
"epoch": 12.077087794432549,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.51171875,
"learning_rate": 9.436100000000001e-06,
"loss": -0.0114,
"num_tokens": 594582523.0,
"reward": 1.0617578506469727,
"reward_std": 0.163472331315279,
"rewards/reward_accuracy/mean": 0.9625,
"rewards/reward_accuracy/std": 0.16072739735245706,
"rewards/reward_format/mean": 0.0992578148841858,
"rewards/reward_format/std": 0.005607722676359117,
"sampling/importance_sampling_ratio/max": 2.3886855840682983,
"sampling/importance_sampling_ratio/mean": 0.9817407727241516,
"sampling/importance_sampling_ratio/min": 0.07721269894391299,
"sampling/sampling_logp_difference/max": 0.9809959888458252,
"sampling/sampling_logp_difference/mean": 0.004320384305901826,
"step": 5640,
"step_time": 7.046387976489496
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1661.4,
"completions/max_terminated_length": 1251.3,
"completions/mean_length": 157.877734375,
"completions/mean_terminated_length": 151.24595947265624,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.05254761867690831,
"epoch": 12.098501070663811,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.2021484375,
"learning_rate": 9.4351e-06,
"loss": -0.0119,
"num_tokens": 595499234.0,
"reward": 1.0688281416893006,
"reward_std": 0.14899665743578225,
"rewards/reward_accuracy/mean": 0.969140625,
"rewards/reward_accuracy/std": 0.14757920429110527,
"rewards/reward_format/mean": 0.09968750104308129,
"rewards/reward_format/std": 0.003397646243683994,
"sampling/importance_sampling_ratio/max": 2.475061559677124,
"sampling/importance_sampling_ratio/mean": 0.9879122734069824,
"sampling/importance_sampling_ratio/min": 0.10055223107337952,
"sampling/sampling_logp_difference/max": 1.0355564475059509,
"sampling/sampling_logp_difference/mean": 0.004193893820047379,
"step": 5650,
"step_time": 7.935750897691468
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012890625,
"completions/max_length": 1662.9,
"completions/max_terminated_length": 1588.7,
"completions/mean_length": 208.476953125,
"completions/mean_terminated_length": 184.90139465332032,
"completions/min_length": 64.7,
"completions/min_terminated_length": 64.7,
"entropy": 0.07150015807710589,
"epoch": 12.119914346895074,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.310546875,
"learning_rate": 9.4341e-06,
"loss": -0.0084,
"num_tokens": 596555143.0,
"reward": 1.0190625131130218,
"reward_std": 0.22929256930947303,
"rewards/reward_accuracy/mean": 0.9203125,
"rewards/reward_accuracy/std": 0.22539855688810348,
"rewards/reward_format/mean": 0.09875000044703483,
"rewards/reward_format/std": 0.008670703554525972,
"sampling/importance_sampling_ratio/max": 2.4657121300697327,
"sampling/importance_sampling_ratio/mean": 0.9778323292732238,
"sampling/importance_sampling_ratio/min": 0.022364795207977295,
"sampling/sampling_logp_difference/max": 0.9056103467941284,
"sampling/sampling_logp_difference/mean": 0.00485207459423691,
"step": 5660,
"step_time": 8.3900178310927
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1761.7,
"completions/max_terminated_length": 1516.5,
"completions/mean_length": 184.953125,
"completions/mean_terminated_length": 166.76575927734376,
"completions/min_length": 68.6,
"completions/min_terminated_length": 68.6,
"entropy": 0.06047582719475031,
"epoch": 12.141327623126339,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.37109375,
"learning_rate": 9.433100000000001e-06,
"loss": -0.0125,
"num_tokens": 597545599.0,
"reward": 1.0530664324760437,
"reward_std": 0.199005676060915,
"rewards/reward_accuracy/mean": 0.95390625,
"rewards/reward_accuracy/std": 0.19515995532274247,
"rewards/reward_format/mean": 0.09916015788912773,
"rewards/reward_format/std": 0.006643663439899683,
"sampling/importance_sampling_ratio/max": 2.6189441204071047,
"sampling/importance_sampling_ratio/mean": 0.994664216041565,
"sampling/importance_sampling_ratio/min": 0.1188847066834569,
"sampling/sampling_logp_difference/max": 1.1123096585273742,
"sampling/sampling_logp_difference/mean": 0.004598545515909791,
"step": 5670,
"step_time": 8.434017101294012
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1243.9,
"completions/max_terminated_length": 1148.0,
"completions/mean_length": 165.703515625,
"completions/mean_terminated_length": 158.4668991088867,
"completions/min_length": 58.2,
"completions/min_terminated_length": 58.2,
"entropy": 0.04618902746587992,
"epoch": 12.162740899357601,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.1474609375,
"learning_rate": 9.4321e-06,
"loss": -0.0071,
"num_tokens": 598484952.0,
"reward": 1.033261740207672,
"reward_std": 0.20581008046865462,
"rewards/reward_accuracy/mean": 0.93359375,
"rewards/reward_accuracy/std": 0.2047041416168213,
"rewards/reward_format/mean": 0.09966797009110451,
"rewards/reward_format/std": 0.003261603508144617,
"sampling/importance_sampling_ratio/max": 2.5863545894622804,
"sampling/importance_sampling_ratio/mean": 1.0039424061775208,
"sampling/importance_sampling_ratio/min": 0.12322017066180706,
"sampling/sampling_logp_difference/max": 0.8898200154304504,
"sampling/sampling_logp_difference/mean": 0.003794911759905517,
"step": 5680,
"step_time": 6.337311634622165
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0140625,
"completions/max_length": 1946.3,
"completions/max_terminated_length": 1791.7,
"completions/mean_length": 210.61015625,
"completions/mean_terminated_length": 184.59593658447267,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.06912515249568969,
"epoch": 12.184154175588866,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.166015625,
"learning_rate": 9.4311e-06,
"loss": -0.0099,
"num_tokens": 599540978.0,
"reward": 1.0251953601837158,
"reward_std": 0.2517545759677887,
"rewards/reward_accuracy/mean": 0.9265625,
"rewards/reward_accuracy/std": 0.24716842770576478,
"rewards/reward_format/mean": 0.09863281473517418,
"rewards/reward_format/std": 0.009184903232380748,
"sampling/importance_sampling_ratio/max": 2.5603103637695312,
"sampling/importance_sampling_ratio/mean": 0.9819427251815795,
"sampling/importance_sampling_ratio/min": 0.05940756399650127,
"sampling/sampling_logp_difference/max": 0.9781868696212769,
"sampling/sampling_logp_difference/mean": 0.0047187290620058775,
"step": 5690,
"step_time": 9.660626240095008
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0171875,
"completions/max_length": 1841.3,
"completions/max_terminated_length": 1670.1,
"completions/mean_length": 218.353125,
"completions/mean_terminated_length": 186.69541931152344,
"completions/min_length": 65.7,
"completions/min_terminated_length": 65.7,
"entropy": 0.07686212863773108,
"epoch": 12.205567451820128,
"frac_reward_zero_std": 0.80625,
"grad_norm": 0.51171875,
"learning_rate": 9.430100000000001e-06,
"loss": -0.014,
"num_tokens": 600620746.0,
"reward": 1.0204883098602295,
"reward_std": 0.25524313300848006,
"rewards/reward_accuracy/mean": 0.921875,
"rewards/reward_accuracy/std": 0.25135541930794714,
"rewards/reward_format/mean": 0.09861328229308128,
"rewards/reward_format/std": 0.009614724526181817,
"sampling/importance_sampling_ratio/max": 2.545870041847229,
"sampling/importance_sampling_ratio/mean": 0.980703866481781,
"sampling/importance_sampling_ratio/min": 0.014662414230224385,
"sampling/sampling_logp_difference/max": 1.8682458043098449,
"sampling/sampling_logp_difference/mean": 0.005277374130673707,
"step": 5700,
"step_time": 9.32679294469708
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1789.2,
"completions/max_terminated_length": 1443.9,
"completions/mean_length": 192.10546875,
"completions/mean_terminated_length": 173.91767120361328,
"completions/min_length": 70.5,
"completions/min_terminated_length": 70.5,
"entropy": 0.0640344767831266,
"epoch": 12.226980728051393,
"frac_reward_zero_std": 0.83125,
"grad_norm": 0.423828125,
"learning_rate": 9.429100000000001e-06,
"loss": -0.0082,
"num_tokens": 601636808.0,
"reward": 1.0245508074760437,
"reward_std": 0.2614011406898499,
"rewards/reward_accuracy/mean": 0.925390625,
"rewards/reward_accuracy/std": 0.2584611564874649,
"rewards/reward_format/mean": 0.09916015863418579,
"rewards/reward_format/std": 0.00722371581941843,
"sampling/importance_sampling_ratio/max": 2.4015860080718996,
"sampling/importance_sampling_ratio/mean": 0.9803305923938751,
"sampling/importance_sampling_ratio/min": 0.06268724463880063,
"sampling/sampling_logp_difference/max": 0.877691251039505,
"sampling/sampling_logp_difference/mean": 0.004685067990794778,
"step": 5710,
"step_time": 8.845224593699095
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 4.604773289429432e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.604773289429432e-06,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 1386.0,
"completions/max_terminated_length": 1262.3,
"completions/mean_length": 176.00078125,
"completions/mean_terminated_length": 146.68090362548827,
"completions/min_length": 62.6,
"completions/min_terminated_length": 62.6,
"entropy": 0.05506518688052893,
"epoch": 12.248394004282655,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.2060546875,
"learning_rate": 9.4281e-06,
"loss": -0.0033,
"num_tokens": 602605802.0,
"reward": 1.0418359816074372,
"reward_std": 0.21052028089761735,
"rewards/reward_accuracy/mean": 0.94296875,
"rewards/reward_accuracy/std": 0.20697149634361267,
"rewards/reward_format/mean": 0.09886718988418579,
"rewards/reward_format/std": 0.006083906348794699,
"sampling/importance_sampling_ratio/max": 2.3649575233459474,
"sampling/importance_sampling_ratio/mean": 0.987731397151947,
"sampling/importance_sampling_ratio/min": 0.1660172201693058,
"sampling/sampling_logp_difference/max": 0.9420099139213562,
"sampling/sampling_logp_difference/mean": 0.004358037794008851,
"step": 5720,
"step_time": 7.1173465007916095
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1358.6,
"completions/max_terminated_length": 1224.1,
"completions/mean_length": 164.63125,
"completions/mean_terminated_length": 154.5560287475586,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"entropy": 0.05160525953397155,
"epoch": 12.269807280513918,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.1572265625,
"learning_rate": 9.427100000000002e-06,
"loss": -0.0007,
"num_tokens": 603550218.0,
"reward": 1.0530664443969726,
"reward_std": 0.18220202773809432,
"rewards/reward_accuracy/mean": 0.953515625,
"rewards/reward_accuracy/std": 0.1807079903781414,
"rewards/reward_format/mean": 0.09955078288912773,
"rewards/reward_format/std": 0.0035304907942190766,
"sampling/importance_sampling_ratio/max": 2.443203628063202,
"sampling/importance_sampling_ratio/mean": 1.0007363736629487,
"sampling/importance_sampling_ratio/min": 0.11013120019051711,
"sampling/sampling_logp_difference/max": 1.5034352004528047,
"sampling/sampling_logp_difference/mean": 0.004271593480370939,
"step": 5730,
"step_time": 6.629654391622171
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1560.0,
"completions/max_terminated_length": 1353.7,
"completions/mean_length": 181.118359375,
"completions/mean_terminated_length": 165.9037307739258,
"completions/min_length": 67.7,
"completions/min_terminated_length": 67.7,
"entropy": 0.05868940055370331,
"epoch": 12.291220556745182,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.51953125,
"learning_rate": 9.4261e-06,
"loss": -0.009,
"num_tokens": 604534617.0,
"reward": 1.0559961259365083,
"reward_std": 0.17403743043541908,
"rewards/reward_accuracy/mean": 0.956640625,
"rewards/reward_accuracy/std": 0.17139192745089532,
"rewards/reward_format/mean": 0.09935546964406967,
"rewards/reward_format/std": 0.00497817147988826,
"sampling/importance_sampling_ratio/max": 2.4144595742225645,
"sampling/importance_sampling_ratio/mean": 0.992537921667099,
"sampling/importance_sampling_ratio/min": 0.12210455536842346,
"sampling/sampling_logp_difference/max": 0.9615453958511353,
"sampling/sampling_logp_difference/mean": 0.004649388929829001,
"step": 5740,
"step_time": 7.521450498193735
},
{
"clip_ratio/high_max": 1.591005566297099e-05,
"clip_ratio/high_mean": 1.9887569578713737e-06,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.9887569578713737e-06,
"completions/clipped_ratio": 0.01640625,
"completions/max_length": 1554.1,
"completions/max_terminated_length": 1360.0,
"completions/mean_length": 203.479296875,
"completions/mean_terminated_length": 173.20055694580077,
"completions/min_length": 62.9,
"completions/min_terminated_length": 62.9,
"entropy": 0.061948522948659955,
"epoch": 12.312633832976445,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.427734375,
"learning_rate": 9.4251e-06,
"loss": -0.0057,
"num_tokens": 605574916.0,
"reward": 1.0310156345367432,
"reward_std": 0.20718577653169631,
"rewards/reward_accuracy/mean": 0.932421875,
"rewards/reward_accuracy/std": 0.20325429886579513,
"rewards/reward_format/mean": 0.09859375059604644,
"rewards/reward_format/std": 0.007858843635767698,
"sampling/importance_sampling_ratio/max": 2.4098456621170046,
"sampling/importance_sampling_ratio/mean": 0.9752326905727386,
"sampling/importance_sampling_ratio/min": 0.08386756852269173,
"sampling/sampling_logp_difference/max": 0.8620923280715942,
"sampling/sampling_logp_difference/mean": 0.00460295001976192,
"step": 5750,
"step_time": 7.959503859901451
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1647.0,
"completions/max_terminated_length": 1487.5,
"completions/mean_length": 182.0859375,
"completions/mean_terminated_length": 165.43701782226563,
"completions/min_length": 70.4,
"completions/min_terminated_length": 70.4,
"entropy": 0.05938649966847152,
"epoch": 12.33404710920771,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.51953125,
"learning_rate": 9.4241e-06,
"loss": -0.0069,
"num_tokens": 606563696.0,
"reward": 1.0443359553813933,
"reward_std": 0.19529686793684958,
"rewards/reward_accuracy/mean": 0.944921875,
"rewards/reward_accuracy/std": 0.19283239766955376,
"rewards/reward_format/mean": 0.09941406399011612,
"rewards/reward_format/std": 0.00492607057094574,
"sampling/importance_sampling_ratio/max": 2.493114674091339,
"sampling/importance_sampling_ratio/mean": 0.9898308992385865,
"sampling/importance_sampling_ratio/min": 0.140733902156353,
"sampling/sampling_logp_difference/max": 0.9629264950752259,
"sampling/sampling_logp_difference/mean": 0.004522768314927816,
"step": 5760,
"step_time": 7.9934567380900265
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 4.042834598294576e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.042834598294576e-06,
"completions/clipped_ratio": 0.012109375,
"completions/max_length": 1782.0,
"completions/max_terminated_length": 1608.9,
"completions/mean_length": 211.095703125,
"completions/mean_terminated_length": 188.89693603515624,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"entropy": 0.0658338325098157,
"epoch": 12.355460385438972,
"frac_reward_zero_std": 0.83125,
"grad_norm": 0.1103515625,
"learning_rate": 9.423100000000001e-06,
"loss": -0.0106,
"num_tokens": 607618725.0,
"reward": 1.0369726955890655,
"reward_std": 0.22573984861373902,
"rewards/reward_accuracy/mean": 0.93828125,
"rewards/reward_accuracy/std": 0.22133282497525214,
"rewards/reward_format/mean": 0.09869140908122062,
"rewards/reward_format/std": 0.007726262928918004,
"sampling/importance_sampling_ratio/max": 2.4390093207359316,
"sampling/importance_sampling_ratio/mean": 0.9769530355930328,
"sampling/importance_sampling_ratio/min": 0.08206974528729916,
"sampling/sampling_logp_difference/max": 0.8987937092781066,
"sampling/sampling_logp_difference/mean": 0.004638170404359698,
"step": 5770,
"step_time": 8.682963506184752
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1564.2,
"completions/max_terminated_length": 1174.6,
"completions/mean_length": 162.935546875,
"completions/mean_terminated_length": 154.85811309814454,
"completions/min_length": 65.3,
"completions/min_terminated_length": 65.3,
"entropy": 0.055407361779361966,
"epoch": 12.376873661670235,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.322265625,
"learning_rate": 9.4221e-06,
"loss": -0.0088,
"num_tokens": 608549168.0,
"reward": 1.0417187809944153,
"reward_std": 0.21444325447082518,
"rewards/reward_accuracy/mean": 0.9421875,
"rewards/reward_accuracy/std": 0.21217553243041037,
"rewards/reward_format/mean": 0.09953125193715096,
"rewards/reward_format/std": 0.004637691820971668,
"sampling/importance_sampling_ratio/max": 2.3178704738616944,
"sampling/importance_sampling_ratio/mean": 0.98563631772995,
"sampling/importance_sampling_ratio/min": 0.14530458617955447,
"sampling/sampling_logp_difference/max": 0.9821771740913391,
"sampling/sampling_logp_difference/mean": 0.004420421342365444,
"step": 5780,
"step_time": 7.483580653497484
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 8.936643780543818e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 8.936643780543818e-07,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1278.2,
"completions/max_terminated_length": 1190.1,
"completions/mean_length": 175.678515625,
"completions/mean_terminated_length": 160.5712448120117,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.05746119660325348,
"epoch": 12.3982869379015,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.337890625,
"learning_rate": 9.4211e-06,
"loss": 0.0006,
"num_tokens": 609516265.0,
"reward": 1.0462500333786011,
"reward_std": 0.2015225447714329,
"rewards/reward_accuracy/mean": 0.946875,
"rewards/reward_accuracy/std": 0.19972300603985788,
"rewards/reward_format/mean": 0.09937500208616257,
"rewards/reward_format/std": 0.003770436905324459,
"sampling/importance_sampling_ratio/max": 2.63529314994812,
"sampling/importance_sampling_ratio/mean": 0.9824238955974579,
"sampling/importance_sampling_ratio/min": 0.21048328429460525,
"sampling/sampling_logp_difference/max": 0.8710582971572876,
"sampling/sampling_logp_difference/mean": 0.004574610409326852,
"step": 5790,
"step_time": 6.467768852089648
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1716.9,
"completions/max_terminated_length": 1501.2,
"completions/mean_length": 169.4234375,
"completions/mean_terminated_length": 163.52413787841797,
"completions/min_length": 61.3,
"completions/min_terminated_length": 61.3,
"entropy": 0.05811231834813953,
"epoch": 12.419700214132762,
"frac_reward_zero_std": 0.81875,
"grad_norm": 0.62890625,
"learning_rate": 9.420100000000002e-06,
"loss": -0.0064,
"num_tokens": 610466629.0,
"reward": 1.050195336341858,
"reward_std": 0.20072563365101814,
"rewards/reward_accuracy/mean": 0.950390625,
"rewards/reward_accuracy/std": 0.19967967867851258,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.0027571488637477158,
"sampling/importance_sampling_ratio/max": 2.4309249401092528,
"sampling/importance_sampling_ratio/mean": 0.9926356434822082,
"sampling/importance_sampling_ratio/min": 0.09058816134929656,
"sampling/sampling_logp_difference/max": 1.0085999965667725,
"sampling/sampling_logp_difference/mean": 0.004817616357468068,
"step": 5800,
"step_time": 8.087330745783401
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1766.6,
"completions/max_terminated_length": 1503.7,
"completions/mean_length": 178.65234375,
"completions/mean_terminated_length": 163.9544250488281,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.057167707360349596,
"epoch": 12.441113490364026,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.796875,
"learning_rate": 9.419100000000001e-06,
"loss": -0.009,
"num_tokens": 611442571.0,
"reward": 1.041875022649765,
"reward_std": 0.207525072991848,
"rewards/reward_accuracy/mean": 0.942578125,
"rewards/reward_accuracy/std": 0.205111500620842,
"rewards/reward_format/mean": 0.09929687604308128,
"rewards/reward_format/std": 0.006091401493176818,
"sampling/importance_sampling_ratio/max": 2.5633439302444456,
"sampling/importance_sampling_ratio/mean": 0.9880888760089874,
"sampling/importance_sampling_ratio/min": 0.0922349214553833,
"sampling/sampling_logp_difference/max": 0.927307766675949,
"sampling/sampling_logp_difference/mean": 0.004534795205108822,
"step": 5810,
"step_time": 8.664851936188644
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1510.6,
"completions/max_terminated_length": 1399.6,
"completions/mean_length": 183.615234375,
"completions/mean_terminated_length": 169.0244369506836,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.05506007431540638,
"epoch": 12.462526766595289,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.97265625,
"learning_rate": 9.4181e-06,
"loss": -0.0064,
"num_tokens": 612430226.0,
"reward": 1.0448242485523225,
"reward_std": 0.18353955447673798,
"rewards/reward_accuracy/mean": 0.945703125,
"rewards/reward_accuracy/std": 0.1805703669786453,
"rewards/reward_format/mean": 0.09912109598517418,
"rewards/reward_format/std": 0.006065029208548367,
"sampling/importance_sampling_ratio/max": 2.3578765630722045,
"sampling/importance_sampling_ratio/mean": 0.9799237728118897,
"sampling/importance_sampling_ratio/min": 0.08135946940165013,
"sampling/sampling_logp_difference/max": 1.0549340009689332,
"sampling/sampling_logp_difference/mean": 0.0044380910461768504,
"step": 5820,
"step_time": 7.5758502312877685
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1606.3,
"completions/max_terminated_length": 1168.0,
"completions/mean_length": 188.396484375,
"completions/mean_terminated_length": 164.89136352539063,
"completions/min_length": 62.5,
"completions/min_terminated_length": 62.5,
"entropy": 0.056072632945142684,
"epoch": 12.483940042826552,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.0,
"learning_rate": 9.417100000000002e-06,
"loss": -0.0079,
"num_tokens": 613429497.0,
"reward": 1.034355491399765,
"reward_std": 0.2217944532632828,
"rewards/reward_accuracy/mean": 0.935546875,
"rewards/reward_accuracy/std": 0.2180061273276806,
"rewards/reward_format/mean": 0.09880859479308128,
"rewards/reward_format/std": 0.00723792240023613,
"sampling/importance_sampling_ratio/max": 2.5908449411392214,
"sampling/importance_sampling_ratio/mean": 0.9759587228298188,
"sampling/importance_sampling_ratio/min": 0.09747508466243744,
"sampling/sampling_logp_difference/max": 0.895580404996872,
"sampling/sampling_logp_difference/mean": 0.004660764615982771,
"step": 5830,
"step_time": 7.807548166194465
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1272.9,
"completions/max_terminated_length": 1224.6,
"completions/mean_length": 165.5203125,
"completions/mean_terminated_length": 156.80058898925782,
"completions/min_length": 67.6,
"completions/min_terminated_length": 67.6,
"entropy": 0.05077431092504412,
"epoch": 12.505353319057816,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.55078125,
"learning_rate": 9.4161e-06,
"loss": -0.0087,
"num_tokens": 614366253.0,
"reward": 1.0659375369548798,
"reward_std": 0.16032854467630386,
"rewards/reward_accuracy/mean": 0.96640625,
"rewards/reward_accuracy/std": 0.15837989300489425,
"rewards/reward_format/mean": 0.09953125193715096,
"rewards/reward_format/std": 0.0032553856261074545,
"sampling/importance_sampling_ratio/max": 2.39215202331543,
"sampling/importance_sampling_ratio/mean": 0.9838303864002228,
"sampling/importance_sampling_ratio/min": 0.13125016260892153,
"sampling/sampling_logp_difference/max": 0.9038776278495788,
"sampling/sampling_logp_difference/mean": 0.004254805576056242,
"step": 5840,
"step_time": 6.127946030595922
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1488.1,
"completions/max_terminated_length": 1447.4,
"completions/mean_length": 184.23671875,
"completions/mean_terminated_length": 179.19318389892578,
"completions/min_length": 60.3,
"completions/min_terminated_length": 60.3,
"entropy": 0.05549403633922338,
"epoch": 12.526766595289079,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.50390625,
"learning_rate": 9.4151e-06,
"loss": -0.003,
"num_tokens": 615359275.0,
"reward": 1.0583593904972077,
"reward_std": 0.1760672241449356,
"rewards/reward_accuracy/mean": 0.95859375,
"rewards/reward_accuracy/std": 0.17522433772683144,
"rewards/reward_format/mean": 0.09976562559604644,
"rewards/reward_format/std": 0.002697975002229214,
"sampling/importance_sampling_ratio/max": 2.6156704425811768,
"sampling/importance_sampling_ratio/mean": 0.9858634114265442,
"sampling/importance_sampling_ratio/min": 0.10775102451443672,
"sampling/sampling_logp_difference/max": 0.8621436953544617,
"sampling/sampling_logp_difference/mean": 0.004336340352892876,
"step": 5850,
"step_time": 7.369927681708941
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 5.5699265885778e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 5.5699265885778e-06,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1596.6,
"completions/max_terminated_length": 1198.1,
"completions/mean_length": 165.174609375,
"completions/mean_terminated_length": 147.21485061645507,
"completions/min_length": 66.4,
"completions/min_terminated_length": 66.4,
"entropy": 0.05274285734631121,
"epoch": 12.548179871520343,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.85546875,
"learning_rate": 9.4141e-06,
"loss": -0.0073,
"num_tokens": 616289386.0,
"reward": 1.0534765720367432,
"reward_std": 0.1999692715704441,
"rewards/reward_accuracy/mean": 0.954296875,
"rewards/reward_accuracy/std": 0.19653414636850358,
"rewards/reward_format/mean": 0.09917968884110451,
"rewards/reward_format/std": 0.0052910294150933625,
"sampling/importance_sampling_ratio/max": 2.371214270591736,
"sampling/importance_sampling_ratio/mean": 0.9801515400409698,
"sampling/importance_sampling_ratio/min": 0.10088480152189731,
"sampling/sampling_logp_difference/max": 0.9351091921329499,
"sampling/sampling_logp_difference/mean": 0.0043000547448173165,
"step": 5860,
"step_time": 7.714587473499705
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.016015625,
"completions/max_length": 1722.7,
"completions/max_terminated_length": 1265.7,
"completions/mean_length": 205.810546875,
"completions/mean_terminated_length": 176.2184036254883,
"completions/min_length": 70.8,
"completions/min_terminated_length": 70.8,
"entropy": 0.056846949039027095,
"epoch": 12.569593147751606,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.11669921875,
"learning_rate": 9.413100000000001e-06,
"loss": -0.007,
"num_tokens": 617329669.0,
"reward": 1.04833984375,
"reward_std": 0.19782272428274156,
"rewards/reward_accuracy/mean": 0.949609375,
"rewards/reward_accuracy/std": 0.1930472768843174,
"rewards/reward_format/mean": 0.09873046875,
"rewards/reward_format/std": 0.008280689734965563,
"sampling/importance_sampling_ratio/max": 2.6153465270996095,
"sampling/importance_sampling_ratio/mean": 0.9741026043891907,
"sampling/importance_sampling_ratio/min": 0.06851990893483162,
"sampling/sampling_logp_difference/max": 0.9510323345661164,
"sampling/sampling_logp_difference/mean": 0.00432861850131303,
"step": 5870,
"step_time": 8.462949119714903
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1314.5,
"completions/max_terminated_length": 1164.5,
"completions/mean_length": 170.938671875,
"completions/mean_terminated_length": 165.17025299072264,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.054320077691227195,
"epoch": 12.591006423982869,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.142578125,
"learning_rate": 9.412100000000001e-06,
"loss": -0.0041,
"num_tokens": 618285128.0,
"reward": 1.0692773580551147,
"reward_std": 0.1518319860100746,
"rewards/reward_accuracy/mean": 0.96953125,
"rewards/reward_accuracy/std": 0.1503058135509491,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.0028824493288993835,
"sampling/importance_sampling_ratio/max": 2.502248668670654,
"sampling/importance_sampling_ratio/mean": 0.9824384987354279,
"sampling/importance_sampling_ratio/min": 0.10430672466754913,
"sampling/sampling_logp_difference/max": 1.201592755317688,
"sampling/sampling_logp_difference/mean": 0.004546273127198219,
"step": 5880,
"step_time": 6.37821057420224
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1383.4,
"completions/max_terminated_length": 977.7,
"completions/mean_length": 177.239453125,
"completions/mean_terminated_length": 161.19956665039064,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.05153019952122122,
"epoch": 12.612419700214133,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.0,
"learning_rate": 9.4111e-06,
"loss": -0.0085,
"num_tokens": 619259613.0,
"reward": 1.0595117211341858,
"reward_std": 0.1627249948680401,
"rewards/reward_accuracy/mean": 0.96015625,
"rewards/reward_accuracy/std": 0.16023046299815177,
"rewards/reward_format/mean": 0.09935547038912773,
"rewards/reward_format/std": 0.005462542409077287,
"sampling/importance_sampling_ratio/max": 2.2735352993011473,
"sampling/importance_sampling_ratio/mean": 0.9822841942310333,
"sampling/importance_sampling_ratio/min": 0.12615805566310884,
"sampling/sampling_logp_difference/max": 1.0899032950401306,
"sampling/sampling_logp_difference/mean": 0.004184899223037064,
"step": 5890,
"step_time": 6.871973862597952
},
{
"clip_ratio/high_max": 2.656183496583253e-05,
"clip_ratio/high_mean": 3.3202293707290663e-06,
"clip_ratio/low_mean": 1.855288883234607e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 5.1755182539636735e-06,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1574.3,
"completions/max_terminated_length": 1465.6,
"completions/mean_length": 188.973046875,
"completions/mean_terminated_length": 173.07948303222656,
"completions/min_length": 67.8,
"completions/min_terminated_length": 67.8,
"entropy": 0.05212015118449927,
"epoch": 12.633832976445396,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.359375,
"learning_rate": 9.410100000000002e-06,
"loss": -0.0093,
"num_tokens": 620267192.0,
"reward": 1.0505468845367432,
"reward_std": 0.19410961121320724,
"rewards/reward_accuracy/mean": 0.951171875,
"rewards/reward_accuracy/std": 0.19176578447222709,
"rewards/reward_format/mean": 0.09937499985098838,
"rewards/reward_format/std": 0.0059676160337403415,
"sampling/importance_sampling_ratio/max": 2.4621610283851623,
"sampling/importance_sampling_ratio/mean": 0.9848306477069855,
"sampling/importance_sampling_ratio/min": 0.11080920631065964,
"sampling/sampling_logp_difference/max": 0.9166821002960205,
"sampling/sampling_logp_difference/mean": 0.003960398258641362,
"step": 5900,
"step_time": 7.76403964991332
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1642.4,
"completions/max_terminated_length": 1449.4,
"completions/mean_length": 173.755859375,
"completions/mean_terminated_length": 159.85626983642578,
"completions/min_length": 67.1,
"completions/min_terminated_length": 67.1,
"entropy": 0.05798751870170236,
"epoch": 12.65524625267666,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.0,
"learning_rate": 9.409100000000001e-06,
"loss": -0.0052,
"num_tokens": 621231847.0,
"reward": 1.0348828375339507,
"reward_std": 0.21437770128250122,
"rewards/reward_accuracy/mean": 0.935546875,
"rewards/reward_accuracy/std": 0.21238058656454087,
"rewards/reward_format/mean": 0.09933593943715095,
"rewards/reward_format/std": 0.004747638013213873,
"sampling/importance_sampling_ratio/max": 2.5113915681838987,
"sampling/importance_sampling_ratio/mean": 0.9812805831432343,
"sampling/importance_sampling_ratio/min": 0.06494654072448611,
"sampling/sampling_logp_difference/max": 0.881912100315094,
"sampling/sampling_logp_difference/mean": 0.004564055544324219,
"step": 5910,
"step_time": 7.925966143596452
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1342.1,
"completions/max_terminated_length": 1135.9,
"completions/mean_length": 164.21796875,
"completions/mean_terminated_length": 156.19948654174806,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.05135643749963492,
"epoch": 12.676659528907923,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.400390625,
"learning_rate": 9.4081e-06,
"loss": -0.0014,
"num_tokens": 622173045.0,
"reward": 1.0725976586341859,
"reward_std": 0.148566185683012,
"rewards/reward_accuracy/mean": 0.973046875,
"rewards/reward_accuracy/std": 0.14675628766417503,
"rewards/reward_format/mean": 0.09955078065395355,
"rewards/reward_format/std": 0.004142312495969236,
"sampling/importance_sampling_ratio/max": 2.5702274084091186,
"sampling/importance_sampling_ratio/mean": 0.9916348040103913,
"sampling/importance_sampling_ratio/min": 0.14274731324985623,
"sampling/sampling_logp_difference/max": 0.7974817276000976,
"sampling/sampling_logp_difference/mean": 0.004343670862726867,
"step": 5920,
"step_time": 6.718525363205117
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1530.3,
"completions/max_terminated_length": 1427.9,
"completions/mean_length": 173.57578125,
"completions/mean_terminated_length": 163.48045654296874,
"completions/min_length": 62.7,
"completions/min_terminated_length": 62.7,
"entropy": 0.05514837384689599,
"epoch": 12.698072805139187,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.1708984375,
"learning_rate": 9.407100000000002e-06,
"loss": -0.0056,
"num_tokens": 623134071.0,
"reward": 1.0568359673023224,
"reward_std": 0.1578554704785347,
"rewards/reward_accuracy/mean": 0.957421875,
"rewards/reward_accuracy/std": 0.1560499280691147,
"rewards/reward_format/mean": 0.09941406399011612,
"rewards/reward_format/std": 0.004469142202287913,
"sampling/importance_sampling_ratio/max": 2.572905707359314,
"sampling/importance_sampling_ratio/mean": 0.9851295471191406,
"sampling/importance_sampling_ratio/min": 0.07678755074739456,
"sampling/sampling_logp_difference/max": 1.0913874626159668,
"sampling/sampling_logp_difference/mean": 0.004460847843438387,
"step": 5930,
"step_time": 7.425587435709895
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1451.4,
"completions/max_terminated_length": 1202.1,
"completions/mean_length": 169.2265625,
"completions/mean_terminated_length": 160.45603942871094,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.05241917388048023,
"epoch": 12.71948608137045,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.330078125,
"learning_rate": 9.4061e-06,
"loss": -0.0119,
"num_tokens": 624083147.0,
"reward": 1.060898447036743,
"reward_std": 0.16876025423407554,
"rewards/reward_accuracy/mean": 0.961328125,
"rewards/reward_accuracy/std": 0.1663830943405628,
"rewards/reward_format/mean": 0.09957031309604644,
"rewards/reward_format/std": 0.004485960793681442,
"sampling/importance_sampling_ratio/max": 2.5108105421066282,
"sampling/importance_sampling_ratio/mean": 0.9842618405818939,
"sampling/importance_sampling_ratio/min": 0.11450974904000759,
"sampling/sampling_logp_difference/max": 0.9349122524261475,
"sampling/sampling_logp_difference/mean": 0.004347665538080037,
"step": 5940,
"step_time": 7.0733569423988225
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1764.1,
"completions/max_terminated_length": 1538.1,
"completions/mean_length": 194.255859375,
"completions/mean_terminated_length": 179.10360412597657,
"completions/min_length": 68.7,
"completions/min_terminated_length": 68.7,
"entropy": 0.060647203726693986,
"epoch": 12.740899357601712,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.265625,
"learning_rate": 9.4051e-06,
"loss": -0.0115,
"num_tokens": 625102842.0,
"reward": 1.0544336080551147,
"reward_std": 0.19346853643655776,
"rewards/reward_accuracy/mean": 0.955078125,
"rewards/reward_accuracy/std": 0.19107425957918167,
"rewards/reward_format/mean": 0.09935546964406967,
"rewards/reward_format/std": 0.005640114448033274,
"sampling/importance_sampling_ratio/max": 2.4650951862335204,
"sampling/importance_sampling_ratio/mean": 0.9759150624275208,
"sampling/importance_sampling_ratio/min": 0.13547723963856698,
"sampling/sampling_logp_difference/max": 1.0470375776290894,
"sampling/sampling_logp_difference/mean": 0.004716541897505522,
"step": 5950,
"step_time": 8.605131533794339
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1718.4,
"completions/max_terminated_length": 1441.0,
"completions/mean_length": 172.572265625,
"completions/mean_terminated_length": 161.66785583496093,
"completions/min_length": 62.4,
"completions/min_terminated_length": 62.4,
"entropy": 0.055740235443226996,
"epoch": 12.762312633832977,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.55859375,
"learning_rate": 9.4041e-06,
"loss": -0.0069,
"num_tokens": 626069555.0,
"reward": 1.0674609541893005,
"reward_std": 0.16577619239687919,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.16324804425239564,
"rewards/reward_format/mean": 0.09949218854308128,
"rewards/reward_format/std": 0.0044956437544897195,
"sampling/importance_sampling_ratio/max": 2.335846173763275,
"sampling/importance_sampling_ratio/mean": 0.980562025308609,
"sampling/importance_sampling_ratio/min": 0.12886929009109735,
"sampling/sampling_logp_difference/max": 0.9938358843326569,
"sampling/sampling_logp_difference/mean": 0.004362940997816622,
"step": 5960,
"step_time": 8.522638974295115
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1625.7,
"completions/max_terminated_length": 1450.9,
"completions/mean_length": 170.116015625,
"completions/mean_terminated_length": 164.26802520751954,
"completions/min_length": 63.1,
"completions/min_terminated_length": 63.1,
"entropy": 0.05669937040656805,
"epoch": 12.78372591006424,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.361328125,
"learning_rate": 9.4031e-06,
"loss": -0.0116,
"num_tokens": 627018444.0,
"reward": 1.050488293170929,
"reward_std": 0.17083199054468423,
"rewards/reward_accuracy/mean": 0.95078125,
"rewards/reward_accuracy/std": 0.16952364519238472,
"rewards/reward_format/mean": 0.09970703199505807,
"rewards/reward_format/std": 0.0032527489122003315,
"sampling/importance_sampling_ratio/max": 2.5882572174072265,
"sampling/importance_sampling_ratio/mean": 0.9946341037750244,
"sampling/importance_sampling_ratio/min": 0.1355404920876026,
"sampling/sampling_logp_difference/max": 0.835493004322052,
"sampling/sampling_logp_difference/mean": 0.0043933948036283255,
"step": 5970,
"step_time": 7.752477190786157
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012109375,
"completions/max_length": 1796.4,
"completions/max_terminated_length": 1367.7,
"completions/mean_length": 180.942578125,
"completions/mean_terminated_length": 158.2283836364746,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.05923593894112855,
"epoch": 12.805139186295504,
"frac_reward_zero_std": 0.83125,
"grad_norm": 0.265625,
"learning_rate": 9.402100000000001e-06,
"loss": -0.0098,
"num_tokens": 627996617.0,
"reward": 1.0529687523841857,
"reward_std": 0.19359346777200698,
"rewards/reward_accuracy/mean": 0.95390625,
"rewards/reward_accuracy/std": 0.1898133136332035,
"rewards/reward_format/mean": 0.0990625001490116,
"rewards/reward_format/std": 0.007041826448403299,
"sampling/importance_sampling_ratio/max": 2.3281317591667174,
"sampling/importance_sampling_ratio/mean": 0.9693376839160919,
"sampling/importance_sampling_ratio/min": 0.10218312768265606,
"sampling/sampling_logp_difference/max": 1.0121137619018554,
"sampling/sampling_logp_difference/mean": 0.004598124139010906,
"step": 5980,
"step_time": 8.932799732897546
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1477.6,
"completions/max_terminated_length": 1401.6,
"completions/mean_length": 182.944921875,
"completions/mean_terminated_length": 173.58944396972657,
"completions/min_length": 69.7,
"completions/min_terminated_length": 69.7,
"entropy": 0.05703109372407198,
"epoch": 12.826552462526767,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.0,
"learning_rate": 9.4011e-06,
"loss": -0.0069,
"num_tokens": 628982268.0,
"reward": 1.0492578327655793,
"reward_std": 0.17598951756954193,
"rewards/reward_accuracy/mean": 0.949609375,
"rewards/reward_accuracy/std": 0.17474506944417953,
"rewards/reward_format/mean": 0.09964843913912773,
"rewards/reward_format/std": 0.002967934194020927,
"sampling/importance_sampling_ratio/max": 2.4445730090141295,
"sampling/importance_sampling_ratio/mean": 0.987162607908249,
"sampling/importance_sampling_ratio/min": 0.10924431586172431,
"sampling/sampling_logp_difference/max": 0.8727828741073609,
"sampling/sampling_logp_difference/mean": 0.004288099566474557,
"step": 5990,
"step_time": 7.29701276740816
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1591.0,
"completions/max_terminated_length": 1289.3,
"completions/mean_length": 180.655078125,
"completions/mean_terminated_length": 165.2904281616211,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.05078198262490332,
"epoch": 12.84796573875803,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.0,
"learning_rate": 9.400100000000002e-06,
"loss": -0.0077,
"num_tokens": 629962777.0,
"reward": 1.0617578387260438,
"reward_std": 0.1715967334806919,
"rewards/reward_accuracy/mean": 0.9625,
"rewards/reward_accuracy/std": 0.1685960814356804,
"rewards/reward_format/mean": 0.09925781413912774,
"rewards/reward_format/std": 0.005604508705437184,
"sampling/importance_sampling_ratio/max": 2.4126978397369383,
"sampling/importance_sampling_ratio/mean": 0.975329440832138,
"sampling/importance_sampling_ratio/min": 0.11152004301548005,
"sampling/sampling_logp_difference/max": 0.8385968565940857,
"sampling/sampling_logp_difference/mean": 0.004216598463244736,
"step": 6000,
"step_time": 7.623216894982034
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1442.7,
"completions/max_terminated_length": 1347.6,
"completions/mean_length": 192.183984375,
"completions/mean_terminated_length": 180.15021209716798,
"completions/min_length": 60.7,
"completions/min_terminated_length": 60.7,
"entropy": 0.06168053704313934,
"epoch": 12.869379014989294,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.578125,
"learning_rate": 9.399100000000001e-06,
"loss": -0.0074,
"num_tokens": 630975712.0,
"reward": 1.0192383170127868,
"reward_std": 0.2422593466937542,
"rewards/reward_accuracy/mean": 0.919921875,
"rewards/reward_accuracy/std": 0.24065417423844337,
"rewards/reward_format/mean": 0.09931640774011612,
"rewards/reward_format/std": 0.004842828353866934,
"sampling/importance_sampling_ratio/max": 2.425437796115875,
"sampling/importance_sampling_ratio/mean": 0.9790128648281098,
"sampling/importance_sampling_ratio/min": 0.058642173558473586,
"sampling/sampling_logp_difference/max": 1.254132330417633,
"sampling/sampling_logp_difference/mean": 0.004664051462896168,
"step": 6010,
"step_time": 6.898478095183964
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1433.9,
"completions/max_terminated_length": 1160.5,
"completions/mean_length": 180.538671875,
"completions/mean_terminated_length": 162.47164916992188,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.055693474737927316,
"epoch": 12.890792291220556,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.478515625,
"learning_rate": 9.3981e-06,
"loss": 0.0003,
"num_tokens": 631952579.0,
"reward": 1.0545508027076722,
"reward_std": 0.16926752477884294,
"rewards/reward_accuracy/mean": 0.95546875,
"rewards/reward_accuracy/std": 0.16640738546848297,
"rewards/reward_format/mean": 0.09908203259110451,
"rewards/reward_format/std": 0.005956802237778902,
"sampling/importance_sampling_ratio/max": 2.579963755607605,
"sampling/importance_sampling_ratio/mean": 0.9909344911575317,
"sampling/importance_sampling_ratio/min": 0.1494994841516018,
"sampling/sampling_logp_difference/max": 1.0741992831230163,
"sampling/sampling_logp_difference/mean": 0.004446077765896917,
"step": 6020,
"step_time": 7.17602092770976
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1691.8,
"completions/max_terminated_length": 1340.9,
"completions/mean_length": 192.399609375,
"completions/mean_terminated_length": 173.56800537109376,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.06407618816010655,
"epoch": 12.91220556745182,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.5703125,
"learning_rate": 9.397100000000002e-06,
"loss": -0.015,
"num_tokens": 632965810.0,
"reward": 1.0378320574760438,
"reward_std": 0.2307739943265915,
"rewards/reward_accuracy/mean": 0.938671875,
"rewards/reward_accuracy/std": 0.2278188206255436,
"rewards/reward_format/mean": 0.09916015863418579,
"rewards/reward_format/std": 0.006536392634734512,
"sampling/importance_sampling_ratio/max": 2.7554094314575197,
"sampling/importance_sampling_ratio/mean": 0.9758197844028473,
"sampling/importance_sampling_ratio/min": 0.0,
"sampling/sampling_logp_difference/max": 1.2738166570663452,
"sampling/sampling_logp_difference/mean": 0.004936163779348135,
"step": 6030,
"step_time": 8.108353263681057
},
{
"clip_ratio/high_max": 3.130912518827245e-05,
"clip_ratio/high_mean": 3.913640648534056e-06,
"clip_ratio/low_mean": 7.172366167651489e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.630877265299205e-06,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1660.7,
"completions/max_terminated_length": 1388.7,
"completions/mean_length": 186.262109375,
"completions/mean_terminated_length": 169.4689910888672,
"completions/min_length": 67.3,
"completions/min_terminated_length": 67.3,
"entropy": 0.056713683251291516,
"epoch": 12.933618843683083,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.47265625,
"learning_rate": 9.3961e-06,
"loss": -0.0055,
"num_tokens": 633963681.0,
"reward": 1.0582422137260437,
"reward_std": 0.1886320613324642,
"rewards/reward_accuracy/mean": 0.958984375,
"rewards/reward_accuracy/std": 0.1857464961707592,
"rewards/reward_format/mean": 0.09925781413912774,
"rewards/reward_format/std": 0.004721511108800769,
"sampling/importance_sampling_ratio/max": 2.3958523750305174,
"sampling/importance_sampling_ratio/mean": 0.9857098042964936,
"sampling/importance_sampling_ratio/min": 0.06021330785006285,
"sampling/sampling_logp_difference/max": 0.9977130830287934,
"sampling/sampling_logp_difference/mean": 0.0043292698916047815,
"step": 6040,
"step_time": 8.129855518415571
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1655.2,
"completions/max_terminated_length": 1382.9,
"completions/mean_length": 172.95546875,
"completions/mean_terminated_length": 161.28251953125,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.0551082206889987,
"epoch": 12.955032119914346,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.322265625,
"learning_rate": 9.395100000000001e-06,
"loss": -0.0095,
"num_tokens": 634929631.0,
"reward": 1.0603710889816285,
"reward_std": 0.16488902568817138,
"rewards/reward_accuracy/mean": 0.9609375,
"rewards/reward_accuracy/std": 0.16311126500368117,
"rewards/reward_format/mean": 0.09943359419703483,
"rewards/reward_format/std": 0.003848617500625551,
"sampling/importance_sampling_ratio/max": 2.3903836011886597,
"sampling/importance_sampling_ratio/mean": 0.9886093854904174,
"sampling/importance_sampling_ratio/min": 0.12995092142373324,
"sampling/sampling_logp_difference/max": 0.9351162314414978,
"sampling/sampling_logp_difference/mean": 0.0044555180240422486,
"step": 6050,
"step_time": 7.778435358617571
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 987.4,
"completions/max_terminated_length": 792.5,
"completions/mean_length": 154.644921875,
"completions/mean_terminated_length": 147.2973419189453,
"completions/min_length": 67.3,
"completions/min_terminated_length": 67.3,
"entropy": 0.04592779432423413,
"epoch": 12.97644539614561,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.439453125,
"learning_rate": 9.3941e-06,
"loss": -0.0009,
"num_tokens": 635836322.0,
"reward": 1.0594140887260437,
"reward_std": 0.16630799546837807,
"rewards/reward_accuracy/mean": 0.959765625,
"rewards/reward_accuracy/std": 0.16493587270379068,
"rewards/reward_format/mean": 0.09964843913912773,
"rewards/reward_format/std": 0.0030286762863397597,
"sampling/importance_sampling_ratio/max": 2.3281902551651,
"sampling/importance_sampling_ratio/mean": 0.9934281945228577,
"sampling/importance_sampling_ratio/min": 0.2002181213349104,
"sampling/sampling_logp_difference/max": 0.9107805728912354,
"sampling/sampling_logp_difference/mean": 0.0041461685905233026,
"step": 6060,
"step_time": 4.8984811954112955
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1301.0,
"completions/max_terminated_length": 1185.4,
"completions/mean_length": 167.426953125,
"completions/mean_terminated_length": 155.68895416259767,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.05482222340069711,
"epoch": 12.997858672376873,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.0576171875,
"learning_rate": 9.3931e-06,
"loss": -0.009,
"num_tokens": 636778775.0,
"reward": 1.0447851777076722,
"reward_std": 0.17821203768253327,
"rewards/reward_accuracy/mean": 0.9453125,
"rewards/reward_accuracy/std": 0.1760790839791298,
"rewards/reward_format/mean": 0.0994726575911045,
"rewards/reward_format/std": 0.004727668082341552,
"sampling/importance_sampling_ratio/max": 2.328642737865448,
"sampling/importance_sampling_ratio/mean": 0.9815492451190948,
"sampling/importance_sampling_ratio/min": 0.14246718175709247,
"sampling/sampling_logp_difference/max": 1.072512835264206,
"sampling/sampling_logp_difference/mean": 0.0044312406796962025,
"step": 6070,
"step_time": 6.462067803103127
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.014453125,
"completions/max_length": 1731.8,
"completions/max_terminated_length": 1416.8,
"completions/mean_length": 196.290234375,
"completions/mean_terminated_length": 169.6153579711914,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"entropy": 0.05354819120839238,
"epoch": 13.019271948608138,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.1748046875,
"learning_rate": 9.392100000000001e-06,
"loss": -0.0018,
"num_tokens": 637795774.0,
"reward": 1.0425390720367431,
"reward_std": 0.1956378124654293,
"rewards/reward_accuracy/mean": 0.94375,
"rewards/reward_accuracy/std": 0.19183124899864196,
"rewards/reward_format/mean": 0.09878906235098839,
"rewards/reward_format/std": 0.007593415328301489,
"sampling/importance_sampling_ratio/max": 2.4580241203308106,
"sampling/importance_sampling_ratio/mean": 0.9800806820392609,
"sampling/importance_sampling_ratio/min": 0.09643867569975555,
"sampling/sampling_logp_difference/max": 1.0183793306350708,
"sampling/sampling_logp_difference/mean": 0.004204807127825916,
"step": 6080,
"step_time": 8.618552715505938
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1442.7,
"completions/max_terminated_length": 1271.0,
"completions/mean_length": 165.6953125,
"completions/mean_terminated_length": 152.54904022216797,
"completions/min_length": 69.5,
"completions/min_terminated_length": 69.5,
"entropy": 0.0527168083935976,
"epoch": 13.0406852248394,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.875,
"learning_rate": 9.3911e-06,
"loss": -0.005,
"num_tokens": 638737026.0,
"reward": 1.0372656404972076,
"reward_std": 0.20753099098801614,
"rewards/reward_accuracy/mean": 0.937890625,
"rewards/reward_accuracy/std": 0.2056211404502392,
"rewards/reward_format/mean": 0.09937500059604645,
"rewards/reward_format/std": 0.004834346729330719,
"sampling/importance_sampling_ratio/max": 2.3592133045196535,
"sampling/importance_sampling_ratio/mean": 0.9825824916362762,
"sampling/importance_sampling_ratio/min": 0.1231397833675146,
"sampling/sampling_logp_difference/max": 1.0914680242538453,
"sampling/sampling_logp_difference/mean": 0.004312032088637352,
"step": 6090,
"step_time": 6.9403699737013085
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1662.7,
"completions/max_terminated_length": 1213.9,
"completions/mean_length": 174.43359375,
"completions/mean_terminated_length": 160.4332534790039,
"completions/min_length": 57.4,
"completions/min_terminated_length": 57.4,
"entropy": 0.0526927248807624,
"epoch": 13.062098501070663,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.18359375,
"learning_rate": 9.3901e-06,
"loss": -0.0051,
"num_tokens": 639702024.0,
"reward": 1.0545312583446502,
"reward_std": 0.18511463701725006,
"rewards/reward_accuracy/mean": 0.955078125,
"rewards/reward_accuracy/std": 0.18289346247911453,
"rewards/reward_format/mean": 0.09945312589406967,
"rewards/reward_format/std": 0.005376762943342328,
"sampling/importance_sampling_ratio/max": 2.4554270267486573,
"sampling/importance_sampling_ratio/mean": 0.9866922318935394,
"sampling/importance_sampling_ratio/min": 0.0804338950663805,
"sampling/sampling_logp_difference/max": 0.8107982575893402,
"sampling/sampling_logp_difference/mean": 0.004309717123396695,
"step": 6100,
"step_time": 8.014343668689254
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012890625,
"completions/max_length": 1853.3,
"completions/max_terminated_length": 1454.8,
"completions/mean_length": 190.354296875,
"completions/mean_terminated_length": 166.3135955810547,
"completions/min_length": 65.6,
"completions/min_terminated_length": 65.6,
"entropy": 0.05961533989757299,
"epoch": 13.083511777301927,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.640625,
"learning_rate": 9.389100000000001e-06,
"loss": -0.0082,
"num_tokens": 640708211.0,
"reward": 1.05142582654953,
"reward_std": 0.19505105614662172,
"rewards/reward_accuracy/mean": 0.952734375,
"rewards/reward_accuracy/std": 0.18924605026841163,
"rewards/reward_format/mean": 0.09869140759110451,
"rewards/reward_format/std": 0.009581877663731576,
"sampling/importance_sampling_ratio/max": 2.523568868637085,
"sampling/importance_sampling_ratio/mean": 0.9845498621463775,
"sampling/importance_sampling_ratio/min": 0.06633601393550634,
"sampling/sampling_logp_difference/max": 1.0529868483543396,
"sampling/sampling_logp_difference/mean": 0.004642502753995359,
"step": 6110,
"step_time": 9.070673936713138
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1542.9,
"completions/max_terminated_length": 1093.3,
"completions/mean_length": 165.92578125,
"completions/mean_terminated_length": 149.67919464111327,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.046920690592378377,
"epoch": 13.10492505353319,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.1513671875,
"learning_rate": 9.3881e-06,
"loss": -0.0008,
"num_tokens": 641644629.0,
"reward": 1.0677539229393005,
"reward_std": 0.16553752794861792,
"rewards/reward_accuracy/mean": 0.968359375,
"rewards/reward_accuracy/std": 0.16266190707683564,
"rewards/reward_format/mean": 0.09939453229308129,
"rewards/reward_format/std": 0.00519488409627229,
"sampling/importance_sampling_ratio/max": 2.3763097763061523,
"sampling/importance_sampling_ratio/mean": 0.9842799007892609,
"sampling/importance_sampling_ratio/min": 0.11030016418080776,
"sampling/sampling_logp_difference/max": 0.9675220310688019,
"sampling/sampling_logp_difference/mean": 0.00403113653883338,
"step": 6120,
"step_time": 7.6589465860190105
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1312.9,
"completions/max_terminated_length": 909.7,
"completions/mean_length": 150.758984375,
"completions/mean_terminated_length": 147.04126586914063,
"completions/min_length": 67.1,
"completions/min_terminated_length": 67.1,
"entropy": 0.04539246587082744,
"epoch": 13.126338329764454,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.470703125,
"learning_rate": 9.387100000000002e-06,
"loss": -0.0024,
"num_tokens": 642545724.0,
"reward": 1.0658398687839508,
"reward_std": 0.14839113801717757,
"rewards/reward_accuracy/mean": 0.966015625,
"rewards/reward_accuracy/std": 0.14735026955604552,
"rewards/reward_format/mean": 0.09982421919703484,
"rewards/reward_format/std": 0.0023887486662715674,
"sampling/importance_sampling_ratio/max": 2.304029476642609,
"sampling/importance_sampling_ratio/mean": 0.9867392718791962,
"sampling/importance_sampling_ratio/min": 0.18247597590088843,
"sampling/sampling_logp_difference/max": 0.8496163606643676,
"sampling/sampling_logp_difference/mean": 0.0040761147858574985,
"step": 6130,
"step_time": 6.286192221299279
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1636.4,
"completions/max_terminated_length": 1269.1,
"completions/mean_length": 175.7640625,
"completions/mean_terminated_length": 162.67023162841798,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.0506550899008289,
"epoch": 13.147751605995717,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.103515625,
"learning_rate": 9.386100000000001e-06,
"loss": -0.0078,
"num_tokens": 643514752.0,
"reward": 1.0618554949760437,
"reward_std": 0.16929182559251785,
"rewards/reward_accuracy/mean": 0.9625,
"rewards/reward_accuracy/std": 0.16594904139637948,
"rewards/reward_format/mean": 0.09935547038912773,
"rewards/reward_format/std": 0.005657023610547185,
"sampling/importance_sampling_ratio/max": 2.481941246986389,
"sampling/importance_sampling_ratio/mean": 0.9921857953071594,
"sampling/importance_sampling_ratio/min": 0.1178208976984024,
"sampling/sampling_logp_difference/max": 0.8457397818565369,
"sampling/sampling_logp_difference/mean": 0.004324799822643399,
"step": 6140,
"step_time": 7.839533890614985
},
{
"clip_ratio/high_max": 3.995525185018778e-06,
"clip_ratio/high_mean": 4.994406481273473e-07,
"clip_ratio/low_mean": 3.6076512969884787e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.107091899641091e-06,
"completions/clipped_ratio": 0.011328125,
"completions/max_length": 1506.7,
"completions/max_terminated_length": 1341.3,
"completions/mean_length": 181.3140625,
"completions/mean_terminated_length": 160.18463439941405,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"entropy": 0.05687512399163097,
"epoch": 13.169164882226982,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.640625,
"learning_rate": 9.385100000000001e-06,
"loss": -0.006,
"num_tokens": 644493780.0,
"reward": 1.064062523841858,
"reward_std": 0.1523667760193348,
"rewards/reward_accuracy/mean": 0.965234375,
"rewards/reward_accuracy/std": 0.14929295852780342,
"rewards/reward_format/mean": 0.09882812723517417,
"rewards/reward_format/std": 0.00639767711982131,
"sampling/importance_sampling_ratio/max": 2.6169324636459352,
"sampling/importance_sampling_ratio/mean": 0.9788672447204589,
"sampling/importance_sampling_ratio/min": 0.10362686812877656,
"sampling/sampling_logp_difference/max": 0.8679514765739441,
"sampling/sampling_logp_difference/mean": 0.0044792864704504606,
"step": 6150,
"step_time": 7.544859561213525
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1660.2,
"completions/max_terminated_length": 1345.9,
"completions/mean_length": 177.75546875,
"completions/mean_terminated_length": 161.23848876953124,
"completions/min_length": 67.9,
"completions/min_terminated_length": 67.9,
"entropy": 0.05308321446646005,
"epoch": 13.190578158458244,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.0,
"learning_rate": 9.3841e-06,
"loss": 0.0007,
"num_tokens": 645467010.0,
"reward": 1.057011741399765,
"reward_std": 0.17173558995127677,
"rewards/reward_accuracy/mean": 0.9578125,
"rewards/reward_accuracy/std": 0.1687103718519211,
"rewards/reward_format/mean": 0.09919922053813934,
"rewards/reward_format/std": 0.0060235628392547366,
"sampling/importance_sampling_ratio/max": 2.4899617195129395,
"sampling/importance_sampling_ratio/mean": 0.9850107908248902,
"sampling/importance_sampling_ratio/min": 0.07209797389805317,
"sampling/sampling_logp_difference/max": 0.8189459979534149,
"sampling/sampling_logp_difference/mean": 0.004106798209249973,
"step": 6160,
"step_time": 8.202825566619868
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1368.8,
"completions/max_terminated_length": 1010.1,
"completions/mean_length": 156.600390625,
"completions/mean_terminated_length": 150.71942596435548,
"completions/min_length": 62.4,
"completions/min_terminated_length": 62.4,
"entropy": 0.044482608302496375,
"epoch": 13.211991434689507,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.275390625,
"learning_rate": 9.3831e-06,
"loss": -0.001,
"num_tokens": 646388419.0,
"reward": 1.058710950613022,
"reward_std": 0.15875827744603158,
"rewards/reward_accuracy/mean": 0.958984375,
"rewards/reward_accuracy/std": 0.1573751114308834,
"rewards/reward_format/mean": 0.09972656294703483,
"rewards/reward_format/std": 0.003210427099838853,
"sampling/importance_sampling_ratio/max": 2.4059749007225038,
"sampling/importance_sampling_ratio/mean": 0.9909905910491943,
"sampling/importance_sampling_ratio/min": 0.18203657045960425,
"sampling/sampling_logp_difference/max": 0.8293358564376831,
"sampling/sampling_logp_difference/mean": 0.004037781455554068,
"step": 6170,
"step_time": 6.531653304988867
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1554.1,
"completions/max_terminated_length": 1469.5,
"completions/mean_length": 174.594921875,
"completions/mean_terminated_length": 155.53646392822264,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.053623323794454336,
"epoch": 13.233404710920771,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.333984375,
"learning_rate": 9.382100000000001e-06,
"loss": -0.0133,
"num_tokens": 647352422.0,
"reward": 1.0386133193969727,
"reward_std": 0.2033396601676941,
"rewards/reward_accuracy/mean": 0.939453125,
"rewards/reward_accuracy/std": 0.20079511180520057,
"rewards/reward_format/mean": 0.09916015714406967,
"rewards/reward_format/std": 0.006422635354101658,
"sampling/importance_sampling_ratio/max": 2.426839530467987,
"sampling/importance_sampling_ratio/mean": 0.9810839474201203,
"sampling/importance_sampling_ratio/min": 0.09947643727064133,
"sampling/sampling_logp_difference/max": 0.9303552806377411,
"sampling/sampling_logp_difference/mean": 0.004248660639859736,
"step": 6180,
"step_time": 7.989747166418238
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1475.3,
"completions/max_terminated_length": 1270.0,
"completions/mean_length": 161.8984375,
"completions/mean_terminated_length": 154.5923645019531,
"completions/min_length": 69.5,
"completions/min_terminated_length": 69.5,
"entropy": 0.05150273919571191,
"epoch": 13.254817987152034,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.44140625,
"learning_rate": 9.3811e-06,
"loss": -0.0068,
"num_tokens": 648288978.0,
"reward": 1.0343750238418579,
"reward_std": 0.2107362225651741,
"rewards/reward_accuracy/mean": 0.934765625,
"rewards/reward_accuracy/std": 0.20953764617443085,
"rewards/reward_format/mean": 0.09960937574505806,
"rewards/reward_format/std": 0.0034033402102068067,
"sampling/importance_sampling_ratio/max": 2.4593056201934815,
"sampling/importance_sampling_ratio/mean": 0.9862347543239594,
"sampling/importance_sampling_ratio/min": 0.08708562254905701,
"sampling/sampling_logp_difference/max": 1.193685418367386,
"sampling/sampling_logp_difference/mean": 0.004307596804574132,
"step": 6190,
"step_time": 7.1619310342910465
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1448.7,
"completions/max_terminated_length": 1014.0,
"completions/mean_length": 151.9984375,
"completions/mean_terminated_length": 144.63111419677733,
"completions/min_length": 59.7,
"completions/min_terminated_length": 59.7,
"entropy": 0.04700648854486644,
"epoch": 13.276231263383298,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.078125,
"learning_rate": 9.3801e-06,
"loss": -0.0012,
"num_tokens": 649190766.0,
"reward": 1.0551757991313935,
"reward_std": 0.18080826848745346,
"rewards/reward_accuracy/mean": 0.95546875,
"rewards/reward_accuracy/std": 0.179557666182518,
"rewards/reward_format/mean": 0.09970703274011612,
"rewards/reward_format/std": 0.0031539242714643478,
"sampling/importance_sampling_ratio/max": 2.5170165419578554,
"sampling/importance_sampling_ratio/mean": 0.9806864142417908,
"sampling/importance_sampling_ratio/min": 0.102097762003541,
"sampling/sampling_logp_difference/max": 0.7850510895252227,
"sampling/sampling_logp_difference/mean": 0.00432643115054816,
"step": 6200,
"step_time": 6.793728359293891
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1372.0,
"completions/max_terminated_length": 1211.0,
"completions/mean_length": 159.058984375,
"completions/mean_terminated_length": 150.88267517089844,
"completions/min_length": 63.2,
"completions/min_terminated_length": 63.2,
"entropy": 0.04709309870377183,
"epoch": 13.297644539614561,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.48828125,
"learning_rate": 9.379100000000001e-06,
"loss": -0.0033,
"num_tokens": 650117477.0,
"reward": 1.0499218940734862,
"reward_std": 0.20451412349939346,
"rewards/reward_accuracy/mean": 0.950390625,
"rewards/reward_accuracy/std": 0.2024371162056923,
"rewards/reward_format/mean": 0.0995312511920929,
"rewards/reward_format/std": 0.0035723690409213303,
"sampling/importance_sampling_ratio/max": 2.50242360830307,
"sampling/importance_sampling_ratio/mean": 0.9812949776649476,
"sampling/importance_sampling_ratio/min": 0.12066646181046962,
"sampling/sampling_logp_difference/max": 0.8992680013179779,
"sampling/sampling_logp_difference/mean": 0.004225170845165849,
"step": 6210,
"step_time": 6.621665466195554
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1544.9,
"completions/max_terminated_length": 1257.4,
"completions/mean_length": 166.8953125,
"completions/mean_terminated_length": 161.7897705078125,
"completions/min_length": 67.6,
"completions/min_terminated_length": 67.6,
"entropy": 0.04926920540165156,
"epoch": 13.319057815845824,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.6953125,
"learning_rate": 9.378100000000001e-06,
"loss": -0.0035,
"num_tokens": 651063337.0,
"reward": 1.0493554770946503,
"reward_std": 0.18624677285552024,
"rewards/reward_accuracy/mean": 0.949609375,
"rewards/reward_accuracy/std": 0.18495556116104125,
"rewards/reward_format/mean": 0.09974609389901161,
"rewards/reward_format/std": 0.003510723193176091,
"sampling/importance_sampling_ratio/max": 2.333652746677399,
"sampling/importance_sampling_ratio/mean": 0.9839352488517761,
"sampling/importance_sampling_ratio/min": 0.0699782244861126,
"sampling/sampling_logp_difference/max": 0.9019779682159423,
"sampling/sampling_logp_difference/mean": 0.004043826484121382,
"step": 6220,
"step_time": 7.412295103803626
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1346.6,
"completions/max_terminated_length": 1212.8,
"completions/mean_length": 162.800390625,
"completions/mean_terminated_length": 156.2483642578125,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.0502274707891047,
"epoch": 13.340471092077088,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.765625,
"learning_rate": 9.3771e-06,
"loss": -0.002,
"num_tokens": 651996666.0,
"reward": 1.0489257872104645,
"reward_std": 0.19876805543899537,
"rewards/reward_accuracy/mean": 0.94921875,
"rewards/reward_accuracy/std": 0.19787064269185067,
"rewards/reward_format/mean": 0.09970703125,
"rewards/reward_format/std": 0.0029989392729476093,
"sampling/importance_sampling_ratio/max": 2.3997358679771423,
"sampling/importance_sampling_ratio/mean": 0.9911199629306793,
"sampling/importance_sampling_ratio/min": 0.12096350640058517,
"sampling/sampling_logp_difference/max": 0.8652910470962525,
"sampling/sampling_logp_difference/mean": 0.004207203490659594,
"step": 6230,
"step_time": 6.562757357614464
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01328125,
"completions/max_length": 1651.5,
"completions/max_terminated_length": 1495.3,
"completions/mean_length": 189.8734375,
"completions/mean_terminated_length": 165.0720703125,
"completions/min_length": 64.4,
"completions/min_terminated_length": 64.4,
"entropy": 0.06312634195201099,
"epoch": 13.36188436830835,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.1162109375,
"learning_rate": 9.376100000000002e-06,
"loss": -0.0032,
"num_tokens": 653001782.0,
"reward": 1.0376953125,
"reward_std": 0.2120852667139843,
"rewards/reward_accuracy/mean": 0.938671875,
"rewards/reward_accuracy/std": 0.2086745947599411,
"rewards/reward_format/mean": 0.0990234375,
"rewards/reward_format/std": 0.006770444591529668,
"sampling/importance_sampling_ratio/max": 2.6526535749435425,
"sampling/importance_sampling_ratio/mean": 0.9912574887275696,
"sampling/importance_sampling_ratio/min": 0.07685638321563601,
"sampling/sampling_logp_difference/max": 0.9565173506736755,
"sampling/sampling_logp_difference/mean": 0.004643832962028682,
"step": 6240,
"step_time": 8.206016044007265
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1775.7,
"completions/max_terminated_length": 1336.8,
"completions/mean_length": 174.509375,
"completions/mean_terminated_length": 159.2458923339844,
"completions/min_length": 63.2,
"completions/min_terminated_length": 63.2,
"entropy": 0.05349827143363654,
"epoch": 13.383297644539615,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.2490234375,
"learning_rate": 9.375100000000001e-06,
"loss": -0.0045,
"num_tokens": 653975150.0,
"reward": 1.0485742330551147,
"reward_std": 0.19780000671744347,
"rewards/reward_accuracy/mean": 0.94921875,
"rewards/reward_accuracy/std": 0.19479114264249803,
"rewards/reward_format/mean": 0.09935546964406967,
"rewards/reward_format/std": 0.005494481977075338,
"sampling/importance_sampling_ratio/max": 2.57766877412796,
"sampling/importance_sampling_ratio/mean": 0.9752013266086579,
"sampling/importance_sampling_ratio/min": 0.09145144950598479,
"sampling/sampling_logp_difference/max": 1.0289781928062438,
"sampling/sampling_logp_difference/mean": 0.0043914201203733684,
"step": 6250,
"step_time": 8.549217757285806
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1912.1,
"completions/max_terminated_length": 1591.2,
"completions/mean_length": 166.64921875,
"completions/mean_terminated_length": 156.41741638183595,
"completions/min_length": 63.7,
"completions/min_terminated_length": 63.7,
"entropy": 0.053987509780563415,
"epoch": 13.404710920770878,
"frac_reward_zero_std": 0.8125,
"grad_norm": 1.2265625,
"learning_rate": 9.3741e-06,
"loss": -0.013,
"num_tokens": 654924540.0,
"reward": 1.0443554759025573,
"reward_std": 0.2042455866932869,
"rewards/reward_accuracy/mean": 0.944921875,
"rewards/reward_accuracy/std": 0.20178447291254997,
"rewards/reward_format/mean": 0.09943359494209289,
"rewards/reward_format/std": 0.005940066976472735,
"sampling/importance_sampling_ratio/max": 2.388659381866455,
"sampling/importance_sampling_ratio/mean": 0.9784941494464874,
"sampling/importance_sampling_ratio/min": 0.11579880490899086,
"sampling/sampling_logp_difference/max": 0.908187985420227,
"sampling/sampling_logp_difference/mean": 0.004428096511401236,
"step": 6260,
"step_time": 9.190583177297958
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1661.4,
"completions/max_terminated_length": 1552.0,
"completions/mean_length": 195.93203125,
"completions/mean_terminated_length": 177.6032684326172,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.06532864493783563,
"epoch": 13.42612419700214,
"frac_reward_zero_std": 0.84375,
"grad_norm": 1.7265625,
"learning_rate": 9.3731e-06,
"loss": -0.0116,
"num_tokens": 655947886.0,
"reward": 1.0314843893051147,
"reward_std": 0.20597516521811485,
"rewards/reward_accuracy/mean": 0.932421875,
"rewards/reward_accuracy/std": 0.20364234447479249,
"rewards/reward_format/mean": 0.0990625001490116,
"rewards/reward_format/std": 0.006530065508559346,
"sampling/importance_sampling_ratio/max": 2.632793402671814,
"sampling/importance_sampling_ratio/mean": 0.983275294303894,
"sampling/importance_sampling_ratio/min": 0.15376686975359916,
"sampling/sampling_logp_difference/max": 0.8940564632415772,
"sampling/sampling_logp_difference/mean": 0.004766634060069918,
"step": 6270,
"step_time": 8.237649959992268
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1509.6,
"completions/max_terminated_length": 1258.5,
"completions/mean_length": 158.97265625,
"completions/mean_terminated_length": 145.91651458740233,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.047490815981291234,
"epoch": 13.447537473233405,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.287109375,
"learning_rate": 9.372100000000001e-06,
"loss": -0.0038,
"num_tokens": 656867576.0,
"reward": 1.0794726729393005,
"reward_std": 0.12454302972182632,
"rewards/reward_accuracy/mean": 0.980078125,
"rewards/reward_accuracy/std": 0.12167773619294167,
"rewards/reward_format/mean": 0.09939453229308129,
"rewards/reward_format/std": 0.00405458458699286,
"sampling/importance_sampling_ratio/max": 2.37939076423645,
"sampling/importance_sampling_ratio/mean": 0.9865086138248443,
"sampling/importance_sampling_ratio/min": 0.15731547102332116,
"sampling/sampling_logp_difference/max": 0.9720810055732727,
"sampling/sampling_logp_difference/mean": 0.0041483440436422825,
"step": 6280,
"step_time": 7.148666684696218
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1189.8,
"completions/max_terminated_length": 882.1,
"completions/mean_length": 144.72734375,
"completions/mean_terminated_length": 140.27078857421876,
"completions/min_length": 68.9,
"completions/min_terminated_length": 68.9,
"entropy": 0.04092986376490444,
"epoch": 13.468950749464668,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0,
"learning_rate": 9.3711e-06,
"loss": -0.0025,
"num_tokens": 657756446.0,
"reward": 1.0770703315734864,
"reward_std": 0.12274166867136956,
"rewards/reward_accuracy/mean": 0.97734375,
"rewards/reward_accuracy/std": 0.12117109224200248,
"rewards/reward_format/mean": 0.0997265636920929,
"rewards/reward_format/std": 0.0029336997773498296,
"sampling/importance_sampling_ratio/max": 2.6196802616119386,
"sampling/importance_sampling_ratio/mean": 0.9921919822692871,
"sampling/importance_sampling_ratio/min": 0.21765816509723662,
"sampling/sampling_logp_difference/max": 0.9087395310401917,
"sampling/sampling_logp_difference/mean": 0.003894891473464668,
"step": 6290,
"step_time": 5.839204334211535
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012109375,
"completions/max_length": 1752.6,
"completions/max_terminated_length": 1399.9,
"completions/mean_length": 194.877734375,
"completions/mean_terminated_length": 172.31782989501954,
"completions/min_length": 67.6,
"completions/min_terminated_length": 67.6,
"entropy": 0.059170945663936436,
"epoch": 13.490364025695932,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.337890625,
"learning_rate": 9.3701e-06,
"loss": -0.013,
"num_tokens": 658775877.0,
"reward": 1.0466992676258087,
"reward_std": 0.20129312872886657,
"rewards/reward_accuracy/mean": 0.94765625,
"rewards/reward_accuracy/std": 0.1975736916065216,
"rewards/reward_format/mean": 0.09904297068715096,
"rewards/reward_format/std": 0.007779728737659752,
"sampling/importance_sampling_ratio/max": 2.425941562652588,
"sampling/importance_sampling_ratio/mean": 0.973828649520874,
"sampling/importance_sampling_ratio/min": 0.1136238157749176,
"sampling/sampling_logp_difference/max": 1.1405448377132417,
"sampling/sampling_logp_difference/mean": 0.004498518421314657,
"step": 6300,
"step_time": 8.593856640098966
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1337.3,
"completions/max_terminated_length": 1138.6,
"completions/mean_length": 171.33515625,
"completions/mean_terminated_length": 164.07163848876954,
"completions/min_length": 63.2,
"completions/min_terminated_length": 63.2,
"entropy": 0.048986665229313074,
"epoch": 13.511777301927195,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.40234375,
"learning_rate": 9.369100000000001e-06,
"loss": -0.0065,
"num_tokens": 659748175.0,
"reward": 1.0594922065734864,
"reward_std": 0.16336871534585953,
"rewards/reward_accuracy/mean": 0.959765625,
"rewards/reward_accuracy/std": 0.1623434379696846,
"rewards/reward_format/mean": 0.0997265636920929,
"rewards/reward_format/std": 0.0023660849314182998,
"sampling/importance_sampling_ratio/max": 2.283779573440552,
"sampling/importance_sampling_ratio/mean": 0.983277440071106,
"sampling/importance_sampling_ratio/min": 0.1474586371332407,
"sampling/sampling_logp_difference/max": 0.9239279687404632,
"sampling/sampling_logp_difference/mean": 0.003922212193720043,
"step": 6310,
"step_time": 6.761331573108327
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1533.4,
"completions/max_terminated_length": 1401.9,
"completions/mean_length": 171.104296875,
"completions/mean_terminated_length": 154.9777099609375,
"completions/min_length": 65.6,
"completions/min_terminated_length": 65.6,
"entropy": 0.05001626529265195,
"epoch": 13.533190578158457,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.365234375,
"learning_rate": 9.368100000000001e-06,
"loss": -0.0059,
"num_tokens": 660699290.0,
"reward": 1.0362890779972076,
"reward_std": 0.22339280620217322,
"rewards/reward_accuracy/mean": 0.937109375,
"rewards/reward_accuracy/std": 0.22100840285420417,
"rewards/reward_format/mean": 0.09917968809604645,
"rewards/reward_format/std": 0.004626548825763166,
"sampling/importance_sampling_ratio/max": 2.408915627002716,
"sampling/importance_sampling_ratio/mean": 0.9918237566947937,
"sampling/importance_sampling_ratio/min": 0.0969219908118248,
"sampling/sampling_logp_difference/max": 0.96937575340271,
"sampling/sampling_logp_difference/mean": 0.004318993585184216,
"step": 6320,
"step_time": 7.372093826596393
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1768.3,
"completions/max_terminated_length": 1468.7,
"completions/mean_length": 178.487890625,
"completions/mean_terminated_length": 171.91040496826173,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.05229062018916011,
"epoch": 13.554603854389722,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.400390625,
"learning_rate": 9.3671e-06,
"loss": -0.0075,
"num_tokens": 661678075.0,
"reward": 1.0461914122104645,
"reward_std": 0.19444930478930472,
"rewards/reward_accuracy/mean": 0.946484375,
"rewards/reward_accuracy/std": 0.192823476344347,
"rewards/reward_format/mean": 0.09970703125,
"rewards/reward_format/std": 0.003921288019046188,
"sampling/importance_sampling_ratio/max": 2.501658391952515,
"sampling/importance_sampling_ratio/mean": 0.9748984396457672,
"sampling/importance_sampling_ratio/min": 0.014323137700557709,
"sampling/sampling_logp_difference/max": 0.9498490512371063,
"sampling/sampling_logp_difference/mean": 0.004328481969423592,
"step": 6330,
"step_time": 8.48923535879003
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1948.1,
"completions/max_terminated_length": 1402.4,
"completions/mean_length": 175.096484375,
"completions/mean_terminated_length": 164.88754577636718,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.056190560571849346,
"epoch": 13.576017130620984,
"frac_reward_zero_std": 0.84375,
"grad_norm": 0.69921875,
"learning_rate": 9.366100000000002e-06,
"loss": -0.0076,
"num_tokens": 662641650.0,
"reward": 1.051523458957672,
"reward_std": 0.200423164665699,
"rewards/reward_accuracy/mean": 0.951953125,
"rewards/reward_accuracy/std": 0.1980856753885746,
"rewards/reward_format/mean": 0.09957031384110451,
"rewards/reward_format/std": 0.004894468956626952,
"sampling/importance_sampling_ratio/max": 2.4903852701187135,
"sampling/importance_sampling_ratio/mean": 0.9898917615413666,
"sampling/importance_sampling_ratio/min": 0.13982707485556603,
"sampling/sampling_logp_difference/max": 0.8962759673595428,
"sampling/sampling_logp_difference/mean": 0.004361913772299886,
"step": 6340,
"step_time": 9.071250657117343
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1575.8,
"completions/max_terminated_length": 1445.4,
"completions/mean_length": 188.05390625,
"completions/mean_terminated_length": 172.00685272216796,
"completions/min_length": 65.3,
"completions/min_terminated_length": 65.3,
"entropy": 0.05808103133458644,
"epoch": 13.597430406852249,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.0,
"learning_rate": 9.3651e-06,
"loss": -0.0059,
"num_tokens": 663637116.0,
"reward": 1.0401562571525573,
"reward_std": 0.21028706282377244,
"rewards/reward_accuracy/mean": 0.941015625,
"rewards/reward_accuracy/std": 0.2072344519197941,
"rewards/reward_format/mean": 0.09914062544703484,
"rewards/reward_format/std": 0.006320220045745372,
"sampling/importance_sampling_ratio/max": 2.4663337230682374,
"sampling/importance_sampling_ratio/mean": 0.975096333026886,
"sampling/importance_sampling_ratio/min": 0.011826204508543015,
"sampling/sampling_logp_difference/max": 0.867270702123642,
"sampling/sampling_logp_difference/mean": 0.00425783961545676,
"step": 6350,
"step_time": 7.779164433004917
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1728.7,
"completions/max_terminated_length": 1289.4,
"completions/mean_length": 173.390625,
"completions/mean_terminated_length": 163.14202728271485,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"entropy": 0.05282252836041153,
"epoch": 13.618843683083512,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.55078125,
"learning_rate": 9.3641e-06,
"loss": -0.0091,
"num_tokens": 664599572.0,
"reward": 1.0491601705551148,
"reward_std": 0.19206472784280776,
"rewards/reward_accuracy/mean": 0.949609375,
"rewards/reward_accuracy/std": 0.19020407125353814,
"rewards/reward_format/mean": 0.09955078214406968,
"rewards/reward_format/std": 0.005171245150268078,
"sampling/importance_sampling_ratio/max": 2.2965982437133787,
"sampling/importance_sampling_ratio/mean": 0.9766180992126465,
"sampling/importance_sampling_ratio/min": 0.08504310101270676,
"sampling/sampling_logp_difference/max": 0.8386000633239746,
"sampling/sampling_logp_difference/mean": 0.00439816564321518,
"step": 6360,
"step_time": 8.379212443108553
},
{
"clip_ratio/high_max": 1.6212710761465132e-05,
"clip_ratio/high_mean": 2.0265888451831415e-06,
"clip_ratio/low_mean": 2.463387727402733e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.489976572585874e-06,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1294.2,
"completions/max_terminated_length": 1200.0,
"completions/mean_length": 177.99765625,
"completions/mean_terminated_length": 159.8431869506836,
"completions/min_length": 73.2,
"completions/min_terminated_length": 73.2,
"entropy": 0.05078420748468489,
"epoch": 13.640256959314776,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.0,
"learning_rate": 9.3631e-06,
"loss": -0.007,
"num_tokens": 665571646.0,
"reward": 1.0443554997444153,
"reward_std": 0.17260719314217568,
"rewards/reward_accuracy/mean": 0.9453125,
"rewards/reward_accuracy/std": 0.16977075561881066,
"rewards/reward_format/mean": 0.09904297143220901,
"rewards/reward_format/std": 0.006035491591319442,
"sampling/importance_sampling_ratio/max": 2.525562286376953,
"sampling/importance_sampling_ratio/mean": 0.9889052212238312,
"sampling/importance_sampling_ratio/min": 0.12683362737298012,
"sampling/sampling_logp_difference/max": 0.9006058275699615,
"sampling/sampling_logp_difference/mean": 0.00438386460300535,
"step": 6370,
"step_time": 6.685426272719633
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1727.0,
"completions/max_terminated_length": 1292.9,
"completions/mean_length": 163.116015625,
"completions/mean_terminated_length": 152.79910278320312,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.04915265969466418,
"epoch": 13.661670235546039,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.177734375,
"learning_rate": 9.362100000000001e-06,
"loss": -0.0013,
"num_tokens": 666505991.0,
"reward": 1.0596093893051148,
"reward_std": 0.15919213742017746,
"rewards/reward_accuracy/mean": 0.96015625,
"rewards/reward_accuracy/std": 0.15645537823438643,
"rewards/reward_format/mean": 0.09945312589406967,
"rewards/reward_format/std": 0.005168350809253752,
"sampling/importance_sampling_ratio/max": 2.4315099120140076,
"sampling/importance_sampling_ratio/mean": 0.9872767210006714,
"sampling/importance_sampling_ratio/min": 0.09565360508859158,
"sampling/sampling_logp_difference/max": 1.1391736626625062,
"sampling/sampling_logp_difference/mean": 0.004337183060124516,
"step": 6380,
"step_time": 8.264577217475743
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1393.9,
"completions/max_terminated_length": 1312.5,
"completions/mean_length": 178.583203125,
"completions/mean_terminated_length": 166.18683166503905,
"completions/min_length": 65.6,
"completions/min_terminated_length": 65.6,
"entropy": 0.054893383546732365,
"epoch": 13.683083511777301,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.0,
"learning_rate": 9.361100000000001e-06,
"loss": -0.0094,
"num_tokens": 667475420.0,
"reward": 1.0573437690734864,
"reward_std": 0.16412511169910432,
"rewards/reward_accuracy/mean": 0.9578125,
"rewards/reward_accuracy/std": 0.1626168668270111,
"rewards/reward_format/mean": 0.0995312511920929,
"rewards/reward_format/std": 0.003531407471746206,
"sampling/importance_sampling_ratio/max": 2.419576358795166,
"sampling/importance_sampling_ratio/mean": 0.9837849736213684,
"sampling/importance_sampling_ratio/min": 0.06855249628424645,
"sampling/sampling_logp_difference/max": 0.8102612614631652,
"sampling/sampling_logp_difference/mean": 0.004396245907992124,
"step": 6390,
"step_time": 6.747032490104902
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1535.1,
"completions/max_terminated_length": 1235.3,
"completions/mean_length": 175.04140625,
"completions/mean_terminated_length": 161.07993240356444,
"completions/min_length": 62.5,
"completions/min_terminated_length": 62.5,
"entropy": 0.053780654165893796,
"epoch": 13.704496788008566,
"frac_reward_zero_std": 0.84375,
"grad_norm": 1.609375,
"learning_rate": 9.3601e-06,
"loss": -0.0011,
"num_tokens": 668436278.0,
"reward": 1.0500781536102295,
"reward_std": 0.1883752927184105,
"rewards/reward_accuracy/mean": 0.95078125,
"rewards/reward_accuracy/std": 0.18552988395094872,
"rewards/reward_format/mean": 0.09929687753319741,
"rewards/reward_format/std": 0.0057085281237959865,
"sampling/importance_sampling_ratio/max": 2.3837275743484496,
"sampling/importance_sampling_ratio/mean": 0.9863021194934845,
"sampling/importance_sampling_ratio/min": 0.12872835695743562,
"sampling/sampling_logp_difference/max": 0.9833871722221375,
"sampling/sampling_logp_difference/mean": 0.00434352804441005,
"step": 6400,
"step_time": 7.51356084648287
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.010546875,
"completions/max_length": 1594.3,
"completions/max_terminated_length": 1484.0,
"completions/mean_length": 194.8875,
"completions/mean_terminated_length": 175.264501953125,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.05940292275045067,
"epoch": 13.725910064239828,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.279296875,
"learning_rate": 9.359100000000002e-06,
"loss": -0.0186,
"num_tokens": 669454534.0,
"reward": 1.0566015839576721,
"reward_std": 0.16762102991342545,
"rewards/reward_accuracy/mean": 0.957421875,
"rewards/reward_accuracy/std": 0.16458993703126906,
"rewards/reward_format/mean": 0.09917968884110451,
"rewards/reward_format/std": 0.006255228398367762,
"sampling/importance_sampling_ratio/max": 2.5067240953445435,
"sampling/importance_sampling_ratio/mean": 0.9686943829059601,
"sampling/importance_sampling_ratio/min": 0.05146309845149517,
"sampling/sampling_logp_difference/max": 0.8527966856956481,
"sampling/sampling_logp_difference/mean": 0.004527035425417126,
"step": 6410,
"step_time": 7.914399105412303
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 8.550990514777368e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 8.550990514777368e-06,
"completions/clipped_ratio": 0.01484375,
"completions/max_length": 1457.7,
"completions/max_terminated_length": 1260.9,
"completions/mean_length": 199.71328125,
"completions/mean_terminated_length": 172.31343994140624,
"completions/min_length": 63.9,
"completions/min_terminated_length": 63.9,
"entropy": 0.058974133571609855,
"epoch": 13.747323340471093,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.216796875,
"learning_rate": 9.358100000000001e-06,
"loss": -0.0016,
"num_tokens": 670479096.0,
"reward": 1.0413867294788361,
"reward_std": 0.2167115181684494,
"rewards/reward_accuracy/mean": 0.942578125,
"rewards/reward_accuracy/std": 0.2129724770784378,
"rewards/reward_format/mean": 0.09880859479308128,
"rewards/reward_format/std": 0.0069346214877441525,
"sampling/importance_sampling_ratio/max": 2.6044188022613524,
"sampling/importance_sampling_ratio/mean": 0.9787875056266785,
"sampling/importance_sampling_ratio/min": 0.12233782596886159,
"sampling/sampling_logp_difference/max": 0.9433415293693542,
"sampling/sampling_logp_difference/mean": 0.004565335367806256,
"step": 6420,
"step_time": 7.32171960240521
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1680.6,
"completions/max_terminated_length": 1567.5,
"completions/mean_length": 181.161328125,
"completions/mean_terminated_length": 168.81618957519532,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.0541982895694673,
"epoch": 13.768736616702355,
"frac_reward_zero_std": 0.83125,
"grad_norm": 0.0,
"learning_rate": 9.3571e-06,
"loss": -0.0028,
"num_tokens": 671459685.0,
"reward": 1.0474218904972077,
"reward_std": 0.19890257641673087,
"rewards/reward_accuracy/mean": 0.948046875,
"rewards/reward_accuracy/std": 0.1967453770339489,
"rewards/reward_format/mean": 0.09937500134110451,
"rewards/reward_format/std": 0.005086789769120514,
"sampling/importance_sampling_ratio/max": 2.447837543487549,
"sampling/importance_sampling_ratio/mean": 0.9932205438613891,
"sampling/importance_sampling_ratio/min": 0.16477308459579945,
"sampling/sampling_logp_difference/max": 0.8984160661697388,
"sampling/sampling_logp_difference/mean": 0.004485658765770495,
"step": 6430,
"step_time": 8.12364383180975
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1480.7,
"completions/max_terminated_length": 1344.7,
"completions/mean_length": 172.6078125,
"completions/mean_terminated_length": 155.8318664550781,
"completions/min_length": 65.3,
"completions/min_terminated_length": 65.3,
"entropy": 0.04904697588644922,
"epoch": 13.790149892933618,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.2216796875,
"learning_rate": 9.356100000000002e-06,
"loss": -0.0095,
"num_tokens": 672424329.0,
"reward": 1.0561718821525574,
"reward_std": 0.18017418906092644,
"rewards/reward_accuracy/mean": 0.95703125,
"rewards/reward_accuracy/std": 0.17720405086874963,
"rewards/reward_format/mean": 0.09914062544703484,
"rewards/reward_format/std": 0.005081167654134333,
"sampling/importance_sampling_ratio/max": 2.4214083671569826,
"sampling/importance_sampling_ratio/mean": 0.9967582762241364,
"sampling/importance_sampling_ratio/min": 0.10222169533371925,
"sampling/sampling_logp_difference/max": 1.090004599094391,
"sampling/sampling_logp_difference/mean": 0.004130501113831997,
"step": 6440,
"step_time": 7.236673405498732
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1576.4,
"completions/max_terminated_length": 1417.9,
"completions/mean_length": 178.16796875,
"completions/mean_terminated_length": 172.337646484375,
"completions/min_length": 68.2,
"completions/min_terminated_length": 68.2,
"entropy": 0.05557680504862219,
"epoch": 13.811563169164883,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.8671875,
"learning_rate": 9.3551e-06,
"loss": -0.0027,
"num_tokens": 673402615.0,
"reward": 1.0298242449760437,
"reward_std": 0.22192211523652078,
"rewards/reward_accuracy/mean": 0.930078125,
"rewards/reward_accuracy/std": 0.2212800092995167,
"rewards/reward_format/mean": 0.09974609389901161,
"rewards/reward_format/std": 0.0028674173634499313,
"sampling/importance_sampling_ratio/max": 2.4718090653419496,
"sampling/importance_sampling_ratio/mean": 0.991068857908249,
"sampling/importance_sampling_ratio/min": 0.0714785099029541,
"sampling/sampling_logp_difference/max": 0.9727436542510987,
"sampling/sampling_logp_difference/mean": 0.004292149026878178,
"step": 6450,
"step_time": 7.610002672381233
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1376.1,
"completions/max_terminated_length": 1227.5,
"completions/mean_length": 178.05,
"completions/mean_terminated_length": 170.82252655029296,
"completions/min_length": 65.3,
"completions/min_terminated_length": 65.3,
"entropy": 0.05068503618240357,
"epoch": 13.832976445396145,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.07275390625,
"learning_rate": 9.3541e-06,
"loss": -0.0017,
"num_tokens": 674379511.0,
"reward": 1.028183603286743,
"reward_std": 0.23838501274585724,
"rewards/reward_accuracy/mean": 0.928515625,
"rewards/reward_accuracy/std": 0.23735610246658326,
"rewards/reward_format/mean": 0.09966796934604645,
"rewards/reward_format/std": 0.00376594876870513,
"sampling/importance_sampling_ratio/max": 2.4470887660980223,
"sampling/importance_sampling_ratio/mean": 0.9802656531333923,
"sampling/importance_sampling_ratio/min": 0.052815625071525575,
"sampling/sampling_logp_difference/max": 0.9030134618282318,
"sampling/sampling_logp_difference/mean": 0.004254769394174218,
"step": 6460,
"step_time": 6.6551671382185305
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1522.9,
"completions/max_terminated_length": 1274.1,
"completions/mean_length": 178.80234375,
"completions/mean_terminated_length": 168.67185821533204,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.05275619283784181,
"epoch": 13.85438972162741,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.625,
"learning_rate": 9.3531e-06,
"loss": -0.0094,
"num_tokens": 675360141.0,
"reward": 1.0491406619548798,
"reward_std": 0.17815189361572265,
"rewards/reward_accuracy/mean": 0.949609375,
"rewards/reward_accuracy/std": 0.176560989767313,
"rewards/reward_format/mean": 0.0995312511920929,
"rewards/reward_format/std": 0.00390942795202136,
"sampling/importance_sampling_ratio/max": 2.3251043558120728,
"sampling/importance_sampling_ratio/mean": 0.9858851194381714,
"sampling/importance_sampling_ratio/min": 0.10143937543034554,
"sampling/sampling_logp_difference/max": 1.1948384463787078,
"sampling/sampling_logp_difference/mean": 0.0043153334874659775,
"step": 6470,
"step_time": 7.439664340412127
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1529.6,
"completions/max_terminated_length": 1314.8,
"completions/mean_length": 179.149609375,
"completions/mean_terminated_length": 163.13965301513673,
"completions/min_length": 68.1,
"completions/min_terminated_length": 68.1,
"entropy": 0.05469238145742565,
"epoch": 13.875802997858672,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.482421875,
"learning_rate": 9.3521e-06,
"loss": 0.0002,
"num_tokens": 676330860.0,
"reward": 1.0553711175918579,
"reward_std": 0.17498880103230477,
"rewards/reward_accuracy/mean": 0.955859375,
"rewards/reward_accuracy/std": 0.17301395460963248,
"rewards/reward_format/mean": 0.09951172024011612,
"rewards/reward_format/std": 0.00494760051369667,
"sampling/importance_sampling_ratio/max": 2.589608335494995,
"sampling/importance_sampling_ratio/mean": 0.9908037722110749,
"sampling/importance_sampling_ratio/min": 0.142070831079036,
"sampling/sampling_logp_difference/max": 0.913347202539444,
"sampling/sampling_logp_difference/mean": 0.00424297337885946,
"step": 6480,
"step_time": 7.496113002896891
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1720.3,
"completions/max_terminated_length": 1413.4,
"completions/mean_length": 192.75078125,
"completions/mean_terminated_length": 179.1056671142578,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"entropy": 0.06374608390033246,
"epoch": 13.897216274089935,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.84375,
"learning_rate": 9.351100000000001e-06,
"loss": -0.0027,
"num_tokens": 677338974.0,
"reward": 1.0492773413658143,
"reward_std": 0.19369202405214309,
"rewards/reward_accuracy/mean": 0.95,
"rewards/reward_accuracy/std": 0.19129842668771743,
"rewards/reward_format/mean": 0.09927734434604644,
"rewards/reward_format/std": 0.005600328813306988,
"sampling/importance_sampling_ratio/max": 2.621599578857422,
"sampling/importance_sampling_ratio/mean": 0.9799755096435547,
"sampling/importance_sampling_ratio/min": 0.07058737874031067,
"sampling/sampling_logp_difference/max": 1.0697132468223571,
"sampling/sampling_logp_difference/mean": 0.004686587234027683,
"step": 6490,
"step_time": 8.42997310210485
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1528.4,
"completions/max_terminated_length": 1235.3,
"completions/mean_length": 162.56484375,
"completions/mean_terminated_length": 153.01941680908203,
"completions/min_length": 63.9,
"completions/min_terminated_length": 63.9,
"entropy": 0.046833317214623096,
"epoch": 13.9186295503212,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.1572265625,
"learning_rate": 9.3501e-06,
"loss": -0.0025,
"num_tokens": 678270948.0,
"reward": 1.0581250190734863,
"reward_std": 0.16899387389421464,
"rewards/reward_accuracy/mean": 0.95859375,
"rewards/reward_accuracy/std": 0.1666727140545845,
"rewards/reward_format/mean": 0.09953125044703484,
"rewards/reward_format/std": 0.00445364851038903,
"sampling/importance_sampling_ratio/max": 2.4631121158599854,
"sampling/importance_sampling_ratio/mean": 0.9960642158985138,
"sampling/importance_sampling_ratio/min": 0.10934389429166913,
"sampling/sampling_logp_difference/max": 0.8482481718063355,
"sampling/sampling_logp_difference/mean": 0.004143555136397481,
"step": 6500,
"step_time": 7.3537006883212594
},
{
"clip_ratio/high_max": 4.0070524846669285e-06,
"clip_ratio/high_mean": 5.008815605833661e-07,
"clip_ratio/low_mean": 2.329606400053308e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.830487960636674e-06,
"completions/clipped_ratio": 0.017578125,
"completions/max_length": 1623.0,
"completions/max_terminated_length": 1524.5,
"completions/mean_length": 192.96328125,
"completions/mean_terminated_length": 160.03733825683594,
"completions/min_length": 65.2,
"completions/min_terminated_length": 65.2,
"entropy": 0.058418584917671976,
"epoch": 13.940042826552462,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.8203125,
"learning_rate": 9.349100000000002e-06,
"loss": -0.0017,
"num_tokens": 679279590.0,
"reward": 1.0406836032867433,
"reward_std": 0.21589941114652902,
"rewards/reward_accuracy/mean": 0.9421875,
"rewards/reward_accuracy/std": 0.2104765847325325,
"rewards/reward_format/mean": 0.09849609360098839,
"rewards/reward_format/std": 0.008288303506560624,
"sampling/importance_sampling_ratio/max": 2.5564252376556396,
"sampling/importance_sampling_ratio/mean": 0.9864274978637695,
"sampling/importance_sampling_ratio/min": 0.127387635409832,
"sampling/sampling_logp_difference/max": 0.8682243227958679,
"sampling/sampling_logp_difference/mean": 0.004394911811687052,
"step": 6510,
"step_time": 8.140909293302684
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 4.651506333175348e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.651506333175348e-06,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 1637.1,
"completions/max_terminated_length": 1409.1,
"completions/mean_length": 208.045703125,
"completions/mean_terminated_length": 179.31230926513672,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.06501091322861612,
"epoch": 13.961456102783727,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.1435546875,
"learning_rate": 9.348100000000001e-06,
"loss": -0.0052,
"num_tokens": 680333259.0,
"reward": 1.0525781333446502,
"reward_std": 0.180988173186779,
"rewards/reward_accuracy/mean": 0.95390625,
"rewards/reward_accuracy/std": 0.17608614563941954,
"rewards/reward_format/mean": 0.09867187365889549,
"rewards/reward_format/std": 0.008468122384510935,
"sampling/importance_sampling_ratio/max": 2.5396952390670777,
"sampling/importance_sampling_ratio/mean": 0.9685321629047394,
"sampling/importance_sampling_ratio/min": 0.07756424397230148,
"sampling/sampling_logp_difference/max": 1.1460471510887147,
"sampling/sampling_logp_difference/mean": 0.0047784664435312155,
"step": 6520,
"step_time": 8.084335012198427
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 2026.7,
"completions/max_terminated_length": 1746.8,
"completions/mean_length": 196.55703125,
"completions/mean_terminated_length": 176.06941680908204,
"completions/min_length": 68.7,
"completions/min_terminated_length": 68.7,
"entropy": 0.061905246274545786,
"epoch": 13.98286937901499,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.484375,
"learning_rate": 9.3471e-06,
"loss": -0.0092,
"num_tokens": 681354573.0,
"reward": 1.0462499976158142,
"reward_std": 0.22375444918870926,
"rewards/reward_accuracy/mean": 0.947265625,
"rewards/reward_accuracy/std": 0.21958387345075608,
"rewards/reward_format/mean": 0.09898437559604645,
"rewards/reward_format/std": 0.008234837185591459,
"sampling/importance_sampling_ratio/max": 2.4826428651809693,
"sampling/importance_sampling_ratio/mean": 0.9852231562137603,
"sampling/importance_sampling_ratio/min": 0.03441601330414414,
"sampling/sampling_logp_difference/max": 1.0374878644943237,
"sampling/sampling_logp_difference/mean": 0.004871854372322559,
"step": 6530,
"step_time": 9.91945659769117
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1261.5,
"completions/max_terminated_length": 1111.6,
"completions/mean_length": 162.83828125,
"completions/mean_terminated_length": 155.6015640258789,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.04525313396006823,
"epoch": 14.004282655246252,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 9.346100000000002e-06,
"loss": -0.0035,
"num_tokens": 682284431.0,
"reward": 1.0738086104393005,
"reward_std": 0.13020229563117028,
"rewards/reward_accuracy/mean": 0.97421875,
"rewards/reward_accuracy/std": 0.1282813549041748,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.0034624657826498153,
"sampling/importance_sampling_ratio/max": 2.3287700176239015,
"sampling/importance_sampling_ratio/mean": 0.9817049920558929,
"sampling/importance_sampling_ratio/min": 0.15568179190158843,
"sampling/sampling_logp_difference/max": 0.7273159742355346,
"sampling/sampling_logp_difference/mean": 0.0040362444007769225,
"step": 6540,
"step_time": 6.128118082709261
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1478.6,
"completions/max_terminated_length": 1273.5,
"completions/mean_length": 172.19765625,
"completions/mean_terminated_length": 162.7085220336914,
"completions/min_length": 71.6,
"completions/min_terminated_length": 71.6,
"entropy": 0.05320281337480992,
"epoch": 14.025695931477516,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.376953125,
"learning_rate": 9.3451e-06,
"loss": -0.0105,
"num_tokens": 683244105.0,
"reward": 1.0701953411102294,
"reward_std": 0.1470729537308216,
"rewards/reward_accuracy/mean": 0.970703125,
"rewards/reward_accuracy/std": 0.14472470209002494,
"rewards/reward_format/mean": 0.09949218928813934,
"rewards/reward_format/std": 0.0049479128792881966,
"sampling/importance_sampling_ratio/max": 2.625271797180176,
"sampling/importance_sampling_ratio/mean": 0.9862457513809204,
"sampling/importance_sampling_ratio/min": 0.08548164842650294,
"sampling/sampling_logp_difference/max": 0.82243732213974,
"sampling/sampling_logp_difference/mean": 0.004398560780100524,
"step": 6550,
"step_time": 7.156919193195063
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1555.1,
"completions/max_terminated_length": 1503.3,
"completions/mean_length": 172.170703125,
"completions/mean_terminated_length": 159.79448699951172,
"completions/min_length": 63.7,
"completions/min_terminated_length": 63.7,
"entropy": 0.054497059620916846,
"epoch": 14.047109207708779,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.0791015625,
"learning_rate": 9.344100000000001e-06,
"loss": -0.008,
"num_tokens": 684203374.0,
"reward": 1.0552148699760437,
"reward_std": 0.17712319493293763,
"rewards/reward_accuracy/mean": 0.955859375,
"rewards/reward_accuracy/std": 0.17513345777988434,
"rewards/reward_format/mean": 0.09935546964406967,
"rewards/reward_format/std": 0.004490146203897894,
"sampling/importance_sampling_ratio/max": 2.4009502053260805,
"sampling/importance_sampling_ratio/mean": 0.9819452047348023,
"sampling/importance_sampling_ratio/min": 0.08036962747573853,
"sampling/sampling_logp_difference/max": 0.9524768590927124,
"sampling/sampling_logp_difference/mean": 0.0043369633378461,
"step": 6560,
"step_time": 7.426552295102738
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.705258248170139e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.705258248170139e-06,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1471.2,
"completions/max_terminated_length": 1286.8,
"completions/mean_length": 187.6296875,
"completions/mean_terminated_length": 170.97235107421875,
"completions/min_length": 67.4,
"completions/min_terminated_length": 67.4,
"entropy": 0.0581747829914093,
"epoch": 14.068522483940043,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.25390625,
"learning_rate": 9.3431e-06,
"loss": -0.0076,
"num_tokens": 685200954.0,
"reward": 1.0410742223262788,
"reward_std": 0.19469581544399261,
"rewards/reward_accuracy/mean": 0.9421875,
"rewards/reward_accuracy/std": 0.19107264429330825,
"rewards/reward_format/mean": 0.09888672009110451,
"rewards/reward_format/std": 0.007666760496795178,
"sampling/importance_sampling_ratio/max": 2.4462778091430666,
"sampling/importance_sampling_ratio/mean": 0.967339938879013,
"sampling/importance_sampling_ratio/min": 0.04349747784435749,
"sampling/sampling_logp_difference/max": 1.0478240847587585,
"sampling/sampling_logp_difference/mean": 0.004439125186763704,
"step": 6570,
"step_time": 7.30057878329535
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1676.4,
"completions/max_terminated_length": 1478.9,
"completions/mean_length": 166.458984375,
"completions/mean_terminated_length": 158.37252960205078,
"completions/min_length": 67.3,
"completions/min_terminated_length": 67.3,
"entropy": 0.049819502211175856,
"epoch": 14.089935760171306,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.1962890625,
"learning_rate": 9.3421e-06,
"loss": -0.0017,
"num_tokens": 686152225.0,
"reward": 1.0680273592472076,
"reward_std": 0.14581480771303176,
"rewards/reward_accuracy/mean": 0.968359375,
"rewards/reward_accuracy/std": 0.1441290371119976,
"rewards/reward_format/mean": 0.09966796934604645,
"rewards/reward_format/std": 0.003964001382701099,
"sampling/importance_sampling_ratio/max": 2.4678235173225405,
"sampling/importance_sampling_ratio/mean": 0.9922048032283783,
"sampling/importance_sampling_ratio/min": 0.10737561457790434,
"sampling/sampling_logp_difference/max": 0.8638099730014801,
"sampling/sampling_logp_difference/mean": 0.004244438023306429,
"step": 6580,
"step_time": 7.978030888197827
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.016015625,
"completions/max_length": 1727.4,
"completions/max_terminated_length": 1496.7,
"completions/mean_length": 198.687109375,
"completions/mean_terminated_length": 168.88742370605468,
"completions/min_length": 70.1,
"completions/min_terminated_length": 70.1,
"entropy": 0.05983603680506348,
"epoch": 14.11134903640257,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.255859375,
"learning_rate": 9.341100000000001e-06,
"loss": -0.0108,
"num_tokens": 687179008.0,
"reward": 1.0506055057048798,
"reward_std": 0.18442369103431702,
"rewards/reward_accuracy/mean": 0.951953125,
"rewards/reward_accuracy/std": 0.17893272265791893,
"rewards/reward_format/mean": 0.09865234494209289,
"rewards/reward_format/std": 0.008971795625984668,
"sampling/importance_sampling_ratio/max": 2.4546991348266602,
"sampling/importance_sampling_ratio/mean": 0.9766439020633697,
"sampling/importance_sampling_ratio/min": 0.08517252262681722,
"sampling/sampling_logp_difference/max": 0.9840207457542419,
"sampling/sampling_logp_difference/mean": 0.00444970962125808,
"step": 6590,
"step_time": 8.679046403401298
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1709.1,
"completions/max_terminated_length": 1596.2,
"completions/mean_length": 186.28515625,
"completions/mean_terminated_length": 173.92142028808593,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"entropy": 0.05730391782708466,
"epoch": 14.132762312633833,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.8203125,
"learning_rate": 9.3401e-06,
"loss": -0.0099,
"num_tokens": 688176522.0,
"reward": 1.0333984673023224,
"reward_std": 0.22489501312375068,
"rewards/reward_accuracy/mean": 0.933984375,
"rewards/reward_accuracy/std": 0.22281435057520865,
"rewards/reward_format/mean": 0.09941406399011612,
"rewards/reward_format/std": 0.005158440233208239,
"sampling/importance_sampling_ratio/max": 2.384672391414642,
"sampling/importance_sampling_ratio/mean": 0.9854220688343048,
"sampling/importance_sampling_ratio/min": 0.03437364138662815,
"sampling/sampling_logp_difference/max": 1.0959331274032593,
"sampling/sampling_logp_difference/mean": 0.004498854535631836,
"step": 6600,
"step_time": 8.324384697599452
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1461.5,
"completions/max_terminated_length": 1301.8,
"completions/mean_length": 164.54921875,
"completions/mean_terminated_length": 156.47599334716796,
"completions/min_length": 67.2,
"completions/min_terminated_length": 67.2,
"entropy": 0.047510938416235146,
"epoch": 14.154175588865096,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.8359375,
"learning_rate": 9.339100000000002e-06,
"loss": -0.0112,
"num_tokens": 689114536.0,
"reward": 1.0675976753234864,
"reward_std": 0.14747019931674005,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.14529308378696443,
"rewards/reward_format/mean": 0.09962890669703484,
"rewards/reward_format/std": 0.004033045051619411,
"sampling/importance_sampling_ratio/max": 2.4341891288757322,
"sampling/importance_sampling_ratio/mean": 0.9876119315624237,
"sampling/importance_sampling_ratio/min": 0.21452969536185265,
"sampling/sampling_logp_difference/max": 0.9052593111991882,
"sampling/sampling_logp_difference/mean": 0.004137600306421518,
"step": 6610,
"step_time": 6.826080052595353
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1906.0,
"completions/max_terminated_length": 1640.6,
"completions/mean_length": 183.509375,
"completions/mean_terminated_length": 167.44212036132814,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"entropy": 0.06267745953518897,
"epoch": 14.17558886509636,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.2578125,
"learning_rate": 9.338100000000001e-06,
"loss": -0.0119,
"num_tokens": 690099648.0,
"reward": 1.0603906631469726,
"reward_std": 0.18434830084443093,
"rewards/reward_accuracy/mean": 0.9609375,
"rewards/reward_accuracy/std": 0.18193155899643898,
"rewards/reward_format/mean": 0.0994531273841858,
"rewards/reward_format/std": 0.004963712766766548,
"sampling/importance_sampling_ratio/max": 2.549701285362244,
"sampling/importance_sampling_ratio/mean": 0.9855315923690796,
"sampling/importance_sampling_ratio/min": 0.03956093140877783,
"sampling/sampling_logp_difference/max": 1.064697015285492,
"sampling/sampling_logp_difference/mean": 0.004918659338727593,
"step": 6620,
"step_time": 8.989886014495278
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.3368385907597257e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.3368385907597257e-06,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1606.2,
"completions/max_terminated_length": 1185.8,
"completions/mean_length": 159.43359375,
"completions/mean_terminated_length": 144.67359466552733,
"completions/min_length": 61.2,
"completions/min_terminated_length": 61.2,
"entropy": 0.04457120527513325,
"epoch": 14.197002141327623,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.36328125,
"learning_rate": 9.3371e-06,
"loss": -0.0022,
"num_tokens": 691017494.0,
"reward": 1.069140625,
"reward_std": 0.13983886644709856,
"rewards/reward_accuracy/mean": 0.969921875,
"rewards/reward_accuracy/std": 0.1361324705183506,
"rewards/reward_format/mean": 0.09921875,
"rewards/reward_format/std": 0.005793217686004937,
"sampling/importance_sampling_ratio/max": 2.3669481754302977,
"sampling/importance_sampling_ratio/mean": 0.9911776721477509,
"sampling/importance_sampling_ratio/min": 0.1088035311549902,
"sampling/sampling_logp_difference/max": 0.9319216549396515,
"sampling/sampling_logp_difference/mean": 0.003832959872670472,
"step": 6630,
"step_time": 7.75838805870153
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1708.1,
"completions/max_terminated_length": 1504.6,
"completions/mean_length": 188.258984375,
"completions/mean_terminated_length": 169.95396423339844,
"completions/min_length": 67.5,
"completions/min_terminated_length": 67.5,
"entropy": 0.053495716163888575,
"epoch": 14.218415417558887,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.9765625,
"learning_rate": 9.336100000000002e-06,
"loss": -0.0058,
"num_tokens": 692021805.0,
"reward": 1.0348047137260437,
"reward_std": 0.23186768889427184,
"rewards/reward_accuracy/mean": 0.935546875,
"rewards/reward_accuracy/std": 0.2291102647781372,
"rewards/reward_format/mean": 0.09925781413912774,
"rewards/reward_format/std": 0.0061144459992647174,
"sampling/importance_sampling_ratio/max": 2.304242491722107,
"sampling/importance_sampling_ratio/mean": 0.9688826382160187,
"sampling/importance_sampling_ratio/min": 0.07745564319193363,
"sampling/sampling_logp_difference/max": 0.9057948470115662,
"sampling/sampling_logp_difference/mean": 0.0043924636207520965,
"step": 6640,
"step_time": 8.461487661101273
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.8393905065750005e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.8393905065750005e-06,
"completions/clipped_ratio": 0.012109375,
"completions/max_length": 1516.6,
"completions/max_terminated_length": 1333.3,
"completions/mean_length": 188.6015625,
"completions/mean_terminated_length": 165.9040084838867,
"completions/min_length": 61.3,
"completions/min_terminated_length": 61.3,
"entropy": 0.05644304535817355,
"epoch": 14.23982869379015,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.275390625,
"learning_rate": 9.3351e-06,
"loss": -0.0068,
"num_tokens": 693017377.0,
"reward": 1.0520703196525574,
"reward_std": 0.1938098356127739,
"rewards/reward_accuracy/mean": 0.953125,
"rewards/reward_accuracy/std": 0.1900540053844452,
"rewards/reward_format/mean": 0.09894531220197678,
"rewards/reward_format/std": 0.007366008241660893,
"sampling/importance_sampling_ratio/max": 2.5217186212539673,
"sampling/importance_sampling_ratio/mean": 0.9721066534519196,
"sampling/importance_sampling_ratio/min": 0.04515217989683151,
"sampling/sampling_logp_difference/max": 0.843786096572876,
"sampling/sampling_logp_difference/mean": 0.004363892902620137,
"step": 6650,
"step_time": 7.695823124004528
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1781.2,
"completions/max_terminated_length": 1276.6,
"completions/mean_length": 171.481640625,
"completions/mean_terminated_length": 152.24789733886718,
"completions/min_length": 61.5,
"completions/min_terminated_length": 61.5,
"entropy": 0.057220308925025165,
"epoch": 14.261241970021413,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.3359375,
"learning_rate": 9.334100000000001e-06,
"loss": -0.014,
"num_tokens": 693972194.0,
"reward": 1.063281273841858,
"reward_std": 0.16724992990493776,
"rewards/reward_accuracy/mean": 0.9640625,
"rewards/reward_accuracy/std": 0.16307274550199508,
"rewards/reward_format/mean": 0.09921875149011612,
"rewards/reward_format/std": 0.006254864414222539,
"sampling/importance_sampling_ratio/max": 2.298472726345062,
"sampling/importance_sampling_ratio/mean": 0.9774664998054504,
"sampling/importance_sampling_ratio/min": 0.07936245575547218,
"sampling/sampling_logp_difference/max": 0.9456567943096161,
"sampling/sampling_logp_difference/mean": 0.004676505597308278,
"step": 6660,
"step_time": 8.44840384349518
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1426.7,
"completions/max_terminated_length": 1104.3,
"completions/mean_length": 162.74140625,
"completions/mean_terminated_length": 146.59091491699218,
"completions/min_length": 63.7,
"completions/min_terminated_length": 63.7,
"entropy": 0.05032870206050575,
"epoch": 14.282655246252677,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0,
"learning_rate": 9.3331e-06,
"loss": -0.0012,
"num_tokens": 694892316.0,
"reward": 1.0559375286102295,
"reward_std": 0.16750391721725463,
"rewards/reward_accuracy/mean": 0.956640625,
"rewards/reward_accuracy/std": 0.1646884486079216,
"rewards/reward_format/mean": 0.09929687678813934,
"rewards/reward_format/std": 0.005572062311694026,
"sampling/importance_sampling_ratio/max": 2.3420160889625548,
"sampling/importance_sampling_ratio/mean": 0.9848093569278717,
"sampling/importance_sampling_ratio/min": 0.12420450653880835,
"sampling/sampling_logp_difference/max": 0.900719964504242,
"sampling/sampling_logp_difference/mean": 0.004278201120905578,
"step": 6670,
"step_time": 7.172061135800322
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1912.5,
"completions/max_terminated_length": 1399.5,
"completions/mean_length": 168.807421875,
"completions/mean_terminated_length": 151.82654037475587,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.04863782261963934,
"epoch": 14.30406852248394,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.984375,
"learning_rate": 9.3321e-06,
"loss": -0.0122,
"num_tokens": 695840975.0,
"reward": 1.0673046946525573,
"reward_std": 0.1618990756571293,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.15804306119680406,
"rewards/reward_format/mean": 0.09933593794703484,
"rewards/reward_format/std": 0.0065110417315736415,
"sampling/importance_sampling_ratio/max": 2.369576406478882,
"sampling/importance_sampling_ratio/mean": 0.9891004264354706,
"sampling/importance_sampling_ratio/min": 0.0764289392158389,
"sampling/sampling_logp_difference/max": 0.8522028863430023,
"sampling/sampling_logp_difference/mean": 0.00422125852201134,
"step": 6680,
"step_time": 9.215180896772655
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1553.1,
"completions/max_terminated_length": 1108.9,
"completions/mean_length": 163.422265625,
"completions/mean_terminated_length": 151.03235626220703,
"completions/min_length": 64.4,
"completions/min_terminated_length": 64.4,
"entropy": 0.04513478884473443,
"epoch": 14.325481798715204,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.3828125,
"learning_rate": 9.331100000000001e-06,
"loss": -0.0035,
"num_tokens": 696774408.0,
"reward": 1.058398461341858,
"reward_std": 0.1728514935122803,
"rewards/reward_accuracy/mean": 0.958984375,
"rewards/reward_accuracy/std": 0.17024307250976561,
"rewards/reward_format/mean": 0.09941406399011612,
"rewards/reward_format/std": 0.004824168211780488,
"sampling/importance_sampling_ratio/max": 2.4532196044921877,
"sampling/importance_sampling_ratio/mean": 0.9819654762744904,
"sampling/importance_sampling_ratio/min": 0.184867337718606,
"sampling/sampling_logp_difference/max": 0.7969536542892456,
"sampling/sampling_logp_difference/mean": 0.0039507665671408175,
"step": 6690,
"step_time": 7.541578272392508
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01484375,
"completions/max_length": 1625.1,
"completions/max_terminated_length": 1276.5,
"completions/mean_length": 196.406640625,
"completions/mean_terminated_length": 169.17852401733398,
"completions/min_length": 60.5,
"completions/min_terminated_length": 60.5,
"entropy": 0.057901989202946424,
"epoch": 14.346895074946467,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.48828125,
"learning_rate": 9.3301e-06,
"loss": -0.0042,
"num_tokens": 697793193.0,
"reward": 1.032617199420929,
"reward_std": 0.2080725833773613,
"rewards/reward_accuracy/mean": 0.933984375,
"rewards/reward_accuracy/std": 0.20319642424583434,
"rewards/reward_format/mean": 0.0986328125,
"rewards/reward_format/std": 0.008245149278081954,
"sampling/importance_sampling_ratio/max": 2.4925456285476684,
"sampling/importance_sampling_ratio/mean": 0.9675654768943787,
"sampling/importance_sampling_ratio/min": 0.11639697067439556,
"sampling/sampling_logp_difference/max": 0.8762841582298279,
"sampling/sampling_logp_difference/mean": 0.004275626549497247,
"step": 6700,
"step_time": 8.35934489229694
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1415.9,
"completions/max_terminated_length": 1171.0,
"completions/mean_length": 161.071484375,
"completions/mean_terminated_length": 155.94279937744142,
"completions/min_length": 62.9,
"completions/min_terminated_length": 62.9,
"entropy": 0.048202042421326044,
"epoch": 14.36830835117773,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.306640625,
"learning_rate": 9.3291e-06,
"loss": -0.0102,
"num_tokens": 698725488.0,
"reward": 1.0610742449760437,
"reward_std": 0.1704031601548195,
"rewards/reward_accuracy/mean": 0.961328125,
"rewards/reward_accuracy/std": 0.1689431369304657,
"rewards/reward_format/mean": 0.09974609538912774,
"rewards/reward_format/std": 0.002825417881831527,
"sampling/importance_sampling_ratio/max": 2.4895697951316835,
"sampling/importance_sampling_ratio/mean": 0.9870150864124299,
"sampling/importance_sampling_ratio/min": 0.06559212021529674,
"sampling/sampling_logp_difference/max": 0.9583218574523926,
"sampling/sampling_logp_difference/mean": 0.004141437355428934,
"step": 6710,
"step_time": 6.901700388704194
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1065.3,
"completions/max_terminated_length": 1035.4,
"completions/mean_length": 159.498046875,
"completions/mean_terminated_length": 155.843701171875,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.05064763673581183,
"epoch": 14.389721627408994,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.7109375,
"learning_rate": 9.328100000000001e-06,
"loss": -0.0053,
"num_tokens": 699654747.0,
"reward": 1.0407812595367432,
"reward_std": 0.18175090178847314,
"rewards/reward_accuracy/mean": 0.941015625,
"rewards/reward_accuracy/std": 0.18129537850618363,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0020544127793982623,
"sampling/importance_sampling_ratio/max": 2.3893194437026977,
"sampling/importance_sampling_ratio/mean": 0.9882461786270141,
"sampling/importance_sampling_ratio/min": 0.15750557705760002,
"sampling/sampling_logp_difference/max": 0.9246626257896423,
"sampling/sampling_logp_difference/mean": 0.004254972329363227,
"step": 6720,
"step_time": 5.431653641909361
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1131.2,
"completions/max_terminated_length": 722.4,
"completions/mean_length": 140.2515625,
"completions/mean_terminated_length": 135.77849578857422,
"completions/min_length": 59.3,
"completions/min_terminated_length": 59.3,
"entropy": 0.03995428506750613,
"epoch": 14.411134903640257,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.162109375,
"learning_rate": 9.327100000000001e-06,
"loss": -0.0113,
"num_tokens": 700525263.0,
"reward": 1.0806054949760437,
"reward_std": 0.10497433468699455,
"rewards/reward_accuracy/mean": 0.980859375,
"rewards/reward_accuracy/std": 0.10345708876848221,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.002746909763664007,
"sampling/importance_sampling_ratio/max": 2.577738046646118,
"sampling/importance_sampling_ratio/mean": 0.9999139666557312,
"sampling/importance_sampling_ratio/min": 0.1265269175171852,
"sampling/sampling_logp_difference/max": 1.128899371623993,
"sampling/sampling_logp_difference/mean": 0.0038805833086371423,
"step": 6730,
"step_time": 5.388003648995072
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1401.7,
"completions/max_terminated_length": 1353.4,
"completions/mean_length": 172.315625,
"completions/mean_terminated_length": 165.94374389648436,
"completions/min_length": 67.9,
"completions/min_terminated_length": 67.9,
"entropy": 0.054124855995178224,
"epoch": 14.432548179871521,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.8984375,
"learning_rate": 9.326100000000002e-06,
"loss": -0.0047,
"num_tokens": 701486951.0,
"reward": 1.0477343797683716,
"reward_std": 0.20155228897929192,
"rewards/reward_accuracy/mean": 0.948046875,
"rewards/reward_accuracy/std": 0.20051689371466636,
"rewards/reward_format/mean": 0.09968750029802323,
"rewards/reward_format/std": 0.0024822521721944214,
"sampling/importance_sampling_ratio/max": 2.50081090927124,
"sampling/importance_sampling_ratio/mean": 0.9862849771976471,
"sampling/importance_sampling_ratio/min": 0.09653355330228805,
"sampling/sampling_logp_difference/max": 0.796488082408905,
"sampling/sampling_logp_difference/mean": 0.004377066041342914,
"step": 6740,
"step_time": 6.638394704091479
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1396.7,
"completions/max_terminated_length": 1159.7,
"completions/mean_length": 173.31484375,
"completions/mean_terminated_length": 162.43994140625,
"completions/min_length": 62.8,
"completions/min_terminated_length": 62.8,
"entropy": 0.04788156980648637,
"epoch": 14.453961456102784,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.66796875,
"learning_rate": 9.3251e-06,
"loss": -0.0065,
"num_tokens": 702453437.0,
"reward": 1.0347461223602294,
"reward_std": 0.2289656274020672,
"rewards/reward_accuracy/mean": 0.93515625,
"rewards/reward_accuracy/std": 0.2275612436234951,
"rewards/reward_format/mean": 0.09958984553813935,
"rewards/reward_format/std": 0.0033990426920354365,
"sampling/importance_sampling_ratio/max": 2.6567326545715333,
"sampling/importance_sampling_ratio/mean": 0.9815601229667663,
"sampling/importance_sampling_ratio/min": 0.12276570070534945,
"sampling/sampling_logp_difference/max": 0.8919889509677887,
"sampling/sampling_logp_difference/mean": 0.0044519302900880575,
"step": 6750,
"step_time": 6.875123873192933
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1625.2,
"completions/max_terminated_length": 1526.3,
"completions/mean_length": 193.3015625,
"completions/mean_terminated_length": 178.3720733642578,
"completions/min_length": 67.9,
"completions/min_terminated_length": 67.9,
"entropy": 0.059805792127735916,
"epoch": 14.475374732334046,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.271484375,
"learning_rate": 9.324100000000001e-06,
"loss": -0.0053,
"num_tokens": 703464593.0,
"reward": 1.053906261920929,
"reward_std": 0.1815737672150135,
"rewards/reward_accuracy/mean": 0.9546875,
"rewards/reward_accuracy/std": 0.17850805595517158,
"rewards/reward_format/mean": 0.09921875,
"rewards/reward_format/std": 0.006415222631767392,
"sampling/importance_sampling_ratio/max": 2.3999356269836425,
"sampling/importance_sampling_ratio/mean": 0.9843855261802673,
"sampling/importance_sampling_ratio/min": 0.05708858743309975,
"sampling/sampling_logp_difference/max": 0.9850981652736663,
"sampling/sampling_logp_difference/mean": 0.00464180582202971,
"step": 6760,
"step_time": 7.977081260996056
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1380.9,
"completions/max_terminated_length": 1217.1,
"completions/mean_length": 159.5421875,
"completions/mean_terminated_length": 148.5271453857422,
"completions/min_length": 68.9,
"completions/min_terminated_length": 68.9,
"entropy": 0.047534760530106725,
"epoch": 14.49678800856531,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.42578125,
"learning_rate": 9.3231e-06,
"loss": -0.0095,
"num_tokens": 704386733.0,
"reward": 1.067753928899765,
"reward_std": 0.12874576076865196,
"rewards/reward_accuracy/mean": 0.968359375,
"rewards/reward_accuracy/std": 0.12679504454135895,
"rewards/reward_format/mean": 0.09939453154802322,
"rewards/reward_format/std": 0.004106677742674947,
"sampling/importance_sampling_ratio/max": 2.3815476417541506,
"sampling/importance_sampling_ratio/mean": 0.9846082985401153,
"sampling/importance_sampling_ratio/min": 0.12139429487287998,
"sampling/sampling_logp_difference/max": 0.8017633557319641,
"sampling/sampling_logp_difference/mean": 0.004203147417865693,
"step": 6770,
"step_time": 6.713376305581187
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1855.1,
"completions/max_terminated_length": 1438.4,
"completions/mean_length": 177.2484375,
"completions/mean_terminated_length": 160.3581985473633,
"completions/min_length": 70.7,
"completions/min_terminated_length": 70.7,
"entropy": 0.05137588568031788,
"epoch": 14.518201284796573,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.10009765625,
"learning_rate": 9.3221e-06,
"loss": -0.0074,
"num_tokens": 705361641.0,
"reward": 1.0621484637260437,
"reward_std": 0.1778969146311283,
"rewards/reward_accuracy/mean": 0.962890625,
"rewards/reward_accuracy/std": 0.1733149029314518,
"rewards/reward_format/mean": 0.09925781339406967,
"rewards/reward_format/std": 0.007206189073622226,
"sampling/importance_sampling_ratio/max": 2.5341822624206545,
"sampling/importance_sampling_ratio/mean": 0.9883440256118774,
"sampling/importance_sampling_ratio/min": 0.03989191800355911,
"sampling/sampling_logp_difference/max": 0.9524598002433777,
"sampling/sampling_logp_difference/mean": 0.0041695707477629185,
"step": 6780,
"step_time": 8.998124456687947
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1804.8,
"completions/max_terminated_length": 1500.0,
"completions/mean_length": 183.256640625,
"completions/mean_terminated_length": 173.78659210205078,
"completions/min_length": 67.1,
"completions/min_terminated_length": 67.1,
"entropy": 0.052130692871287465,
"epoch": 14.539614561027838,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.0,
"learning_rate": 9.321100000000001e-06,
"loss": -0.0026,
"num_tokens": 706350218.0,
"reward": 1.0562304735183716,
"reward_std": 0.1830668143928051,
"rewards/reward_accuracy/mean": 0.956640625,
"rewards/reward_accuracy/std": 0.18135236576199532,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.004562927829101682,
"sampling/importance_sampling_ratio/max": 2.623989129066467,
"sampling/importance_sampling_ratio/mean": 0.9823902010917663,
"sampling/importance_sampling_ratio/min": 0.05765081662684679,
"sampling/sampling_logp_difference/max": 1.0112012684345246,
"sampling/sampling_logp_difference/mean": 0.004439583886414767,
"step": 6790,
"step_time": 8.824140011510462
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1928.5,
"completions/max_terminated_length": 1556.5,
"completions/mean_length": 198.819921875,
"completions/mean_terminated_length": 179.8333541870117,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.06357498457655311,
"epoch": 14.5610278372591,
"frac_reward_zero_std": 0.83125,
"grad_norm": 0.212890625,
"learning_rate": 9.3201e-06,
"loss": -0.018,
"num_tokens": 707388253.0,
"reward": 1.0345898628234864,
"reward_std": 0.23613991886377333,
"rewards/reward_accuracy/mean": 0.935546875,
"rewards/reward_accuracy/std": 0.2324522003531456,
"rewards/reward_format/mean": 0.09904296919703484,
"rewards/reward_format/std": 0.008377116546034813,
"sampling/importance_sampling_ratio/max": 2.38506395816803,
"sampling/importance_sampling_ratio/mean": 0.9799875617027283,
"sampling/importance_sampling_ratio/min": 0.04198810569941998,
"sampling/sampling_logp_difference/max": 0.8920201539993287,
"sampling/sampling_logp_difference/mean": 0.004787348513491452,
"step": 6800,
"step_time": 9.37613146189542
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1752.7,
"completions/max_terminated_length": 1701.9,
"completions/mean_length": 191.073828125,
"completions/mean_terminated_length": 172.89031524658202,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"entropy": 0.058648336585611104,
"epoch": 14.582441113490365,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.8828125,
"learning_rate": 9.3191e-06,
"loss": 0.0042,
"num_tokens": 708393018.0,
"reward": 1.0425390958786012,
"reward_std": 0.2117415636777878,
"rewards/reward_accuracy/mean": 0.943359375,
"rewards/reward_accuracy/std": 0.20881196558475495,
"rewards/reward_format/mean": 0.09917968884110451,
"rewards/reward_format/std": 0.0053989689098671075,
"sampling/importance_sampling_ratio/max": 2.425023281574249,
"sampling/importance_sampling_ratio/mean": 0.9836126267910004,
"sampling/importance_sampling_ratio/min": 0.05785171533934772,
"sampling/sampling_logp_difference/max": 1.0890108942985535,
"sampling/sampling_logp_difference/mean": 0.004569166200235486,
"step": 6810,
"step_time": 8.708844897005473
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1328.9,
"completions/max_terminated_length": 1096.9,
"completions/mean_length": 161.963671875,
"completions/mean_terminated_length": 152.43516998291017,
"completions/min_length": 67.5,
"completions/min_terminated_length": 67.5,
"entropy": 0.04694010503590107,
"epoch": 14.603854389721628,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.19140625,
"learning_rate": 9.318100000000001e-06,
"loss": -0.0075,
"num_tokens": 709329581.0,
"reward": 1.0520703315734863,
"reward_std": 0.18057689294219018,
"rewards/reward_accuracy/mean": 0.95234375,
"rewards/reward_accuracy/std": 0.17945568785071372,
"rewards/reward_format/mean": 0.0997265636920929,
"rewards/reward_format/std": 0.0030682745389640333,
"sampling/importance_sampling_ratio/max": 2.4275245547294615,
"sampling/importance_sampling_ratio/mean": 0.9935319781303406,
"sampling/importance_sampling_ratio/min": 0.19546640887856484,
"sampling/sampling_logp_difference/max": 0.9341620683670044,
"sampling/sampling_logp_difference/mean": 0.004085478186607361,
"step": 6820,
"step_time": 6.40264006999787
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1515.7,
"completions/max_terminated_length": 1285.2,
"completions/mean_length": 176.334765625,
"completions/mean_terminated_length": 165.41882781982423,
"completions/min_length": 68.4,
"completions/min_terminated_length": 68.4,
"entropy": 0.04765942755620926,
"epoch": 14.62526766595289,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.271484375,
"learning_rate": 9.317100000000001e-06,
"loss": -0.0027,
"num_tokens": 710307462.0,
"reward": 1.0533789277076722,
"reward_std": 0.18152436271775513,
"rewards/reward_accuracy/mean": 0.95390625,
"rewards/reward_accuracy/std": 0.17930537238717079,
"rewards/reward_format/mean": 0.09947265684604645,
"rewards/reward_format/std": 0.004613026650622487,
"sampling/importance_sampling_ratio/max": 2.410773825645447,
"sampling/importance_sampling_ratio/mean": 0.9851631462574005,
"sampling/importance_sampling_ratio/min": 0.10066772848367692,
"sampling/sampling_logp_difference/max": 0.9407067060470581,
"sampling/sampling_logp_difference/mean": 0.004134602076373994,
"step": 6830,
"step_time": 7.387078507195111
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1508.1,
"completions/max_terminated_length": 1361.4,
"completions/mean_length": 155.3140625,
"completions/mean_terminated_length": 149.4014144897461,
"completions/min_length": 60.1,
"completions/min_terminated_length": 60.1,
"entropy": 0.046409597457386556,
"epoch": 14.646680942184155,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.2197265625,
"learning_rate": 9.3161e-06,
"loss": -0.0054,
"num_tokens": 711225002.0,
"reward": 1.0521679818630219,
"reward_std": 0.1828407861292362,
"rewards/reward_accuracy/mean": 0.95234375,
"rewards/reward_accuracy/std": 0.1821254163980484,
"rewards/reward_format/mean": 0.09982421919703484,
"rewards/reward_format/std": 0.0023328486597165464,
"sampling/importance_sampling_ratio/max": 2.542582702636719,
"sampling/importance_sampling_ratio/mean": 0.9904893100261688,
"sampling/importance_sampling_ratio/min": 0.17083930112421514,
"sampling/sampling_logp_difference/max": 1.0114613056182862,
"sampling/sampling_logp_difference/mean": 0.004324109549634159,
"step": 6840,
"step_time": 7.135511041100836
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1637.1,
"completions/max_terminated_length": 1513.2,
"completions/mean_length": 174.569140625,
"completions/mean_terminated_length": 171.65736541748046,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.05468369123991579,
"epoch": 14.668094218415417,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.6796875,
"learning_rate": 9.3151e-06,
"loss": -0.0046,
"num_tokens": 712192379.0,
"reward": 1.0552734375,
"reward_std": 0.18204848682507874,
"rewards/reward_accuracy/mean": 0.95546875,
"rewards/reward_accuracy/std": 0.18094336837530137,
"rewards/reward_format/mean": 0.0998046875,
"rewards/reward_format/std": 0.0025173229863867165,
"sampling/importance_sampling_ratio/max": 2.57432861328125,
"sampling/importance_sampling_ratio/mean": 0.991272646188736,
"sampling/importance_sampling_ratio/min": 0.06532978974282741,
"sampling/sampling_logp_difference/max": 1.016486918926239,
"sampling/sampling_logp_difference/mean": 0.004380824347026646,
"step": 6850,
"step_time": 7.772263872998883
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1540.6,
"completions/max_terminated_length": 1498.4,
"completions/mean_length": 160.26015625,
"completions/mean_terminated_length": 155.16331329345704,
"completions/min_length": 62.9,
"completions/min_terminated_length": 62.9,
"entropy": 0.049659232539124784,
"epoch": 14.689507494646682,
"frac_reward_zero_std": 0.8375,
"grad_norm": 0.12158203125,
"learning_rate": 9.314100000000001e-06,
"loss": -0.0084,
"num_tokens": 713118965.0,
"reward": 1.057480478286743,
"reward_std": 0.18724769726395607,
"rewards/reward_accuracy/mean": 0.9578125,
"rewards/reward_accuracy/std": 0.1856343537569046,
"rewards/reward_format/mean": 0.09966797009110451,
"rewards/reward_format/std": 0.0032466852571815252,
"sampling/importance_sampling_ratio/max": 2.4764386892318724,
"sampling/importance_sampling_ratio/mean": 0.9902539730072022,
"sampling/importance_sampling_ratio/min": 0.1311547640711069,
"sampling/sampling_logp_difference/max": 0.8617129027843475,
"sampling/sampling_logp_difference/mean": 0.004276928049512208,
"step": 6860,
"step_time": 7.266769448510604
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1335.2,
"completions/max_terminated_length": 778.3,
"completions/mean_length": 144.21640625,
"completions/mean_terminated_length": 137.51972579956055,
"completions/min_length": 62.7,
"completions/min_terminated_length": 62.7,
"entropy": 0.04132047772873193,
"epoch": 14.710920770877944,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.2080078125,
"learning_rate": 9.3131e-06,
"loss": -0.0,
"num_tokens": 713999151.0,
"reward": 1.071093773841858,
"reward_std": 0.15160216987133027,
"rewards/reward_accuracy/mean": 0.971484375,
"rewards/reward_accuracy/std": 0.14938208609819412,
"rewards/reward_format/mean": 0.09960937649011611,
"rewards/reward_format/std": 0.004186975210905075,
"sampling/importance_sampling_ratio/max": 2.419086515903473,
"sampling/importance_sampling_ratio/mean": 0.9906135618686676,
"sampling/importance_sampling_ratio/min": 0.12863239720463754,
"sampling/sampling_logp_difference/max": 0.844602370262146,
"sampling/sampling_logp_difference/mean": 0.0038484664866700767,
"step": 6870,
"step_time": 6.438652803108562
},
{
"clip_ratio/high_max": 4.581474931910634e-05,
"clip_ratio/high_mean": 5.726843664888293e-06,
"clip_ratio/low_mean": 2.3057895532474502e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 8.032633218135743e-06,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1329.5,
"completions/max_terminated_length": 1098.0,
"completions/mean_length": 154.596484375,
"completions/mean_terminated_length": 136.7020263671875,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.04567404547706246,
"epoch": 14.732334047109207,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.390625,
"learning_rate": 9.3121e-06,
"loss": -0.0064,
"num_tokens": 714912134.0,
"reward": 1.0499218940734862,
"reward_std": 0.1872471198439598,
"rewards/reward_accuracy/mean": 0.95078125,
"rewards/reward_accuracy/std": 0.1842402160167694,
"rewards/reward_format/mean": 0.09914062693715095,
"rewards/reward_format/std": 0.0051398361567407845,
"sampling/importance_sampling_ratio/max": 2.5863495588302614,
"sampling/importance_sampling_ratio/mean": 0.9920466840267181,
"sampling/importance_sampling_ratio/min": 0.1332883623894304,
"sampling/sampling_logp_difference/max": 0.8809935688972473,
"sampling/sampling_logp_difference/mean": 0.004025020892731846,
"step": 6880,
"step_time": 6.81902347971045
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1434.3,
"completions/max_terminated_length": 1267.5,
"completions/mean_length": 175.79453125,
"completions/mean_terminated_length": 160.5271469116211,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.05293139966670424,
"epoch": 14.753747323340471,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.46875,
"learning_rate": 9.311100000000001e-06,
"loss": -0.0028,
"num_tokens": 715883992.0,
"reward": 1.0375976860523224,
"reward_std": 0.1968364879488945,
"rewards/reward_accuracy/mean": 0.93828125,
"rewards/reward_accuracy/std": 0.19473396241664886,
"rewards/reward_format/mean": 0.09931640774011612,
"rewards/reward_format/std": 0.005867378716357052,
"sampling/importance_sampling_ratio/max": 2.527586054801941,
"sampling/importance_sampling_ratio/mean": 0.9760892212390899,
"sampling/importance_sampling_ratio/min": 0.08030531257390976,
"sampling/sampling_logp_difference/max": 0.9022899329662323,
"sampling/sampling_logp_difference/mean": 0.004367918148636818,
"step": 6890,
"step_time": 7.089630370089435
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1569.3,
"completions/max_terminated_length": 1201.9,
"completions/mean_length": 153.66875,
"completions/mean_terminated_length": 144.7492462158203,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.045841248147189616,
"epoch": 14.775160599571734,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.337890625,
"learning_rate": 9.310100000000001e-06,
"loss": -0.0061,
"num_tokens": 716792936.0,
"reward": 1.0758008122444154,
"reward_std": 0.12053357511758804,
"rewards/reward_accuracy/mean": 0.976171875,
"rewards/reward_accuracy/std": 0.11822620779275894,
"rewards/reward_format/mean": 0.09962890744209289,
"rewards/reward_format/std": 0.0043895982671529055,
"sampling/importance_sampling_ratio/max": 2.3242186546325683,
"sampling/importance_sampling_ratio/mean": 0.9872884154319763,
"sampling/importance_sampling_ratio/min": 0.07168888701125979,
"sampling/sampling_logp_difference/max": 0.8753412663936615,
"sampling/sampling_logp_difference/mean": 0.004187392280437052,
"step": 6900,
"step_time": 7.4654080808919385
},
{
"clip_ratio/high_max": 6.008652417222038e-06,
"clip_ratio/high_mean": 7.510815521527548e-07,
"clip_ratio/low_mean": 1.0030098565039225e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.7540914086566771e-06,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1573.3,
"completions/max_terminated_length": 1245.5,
"completions/mean_length": 166.3265625,
"completions/mean_terminated_length": 151.68939819335938,
"completions/min_length": 68.2,
"completions/min_terminated_length": 68.2,
"entropy": 0.04777605349663645,
"epoch": 14.796573875802999,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.16015625,
"learning_rate": 9.3091e-06,
"loss": -0.0089,
"num_tokens": 717737148.0,
"reward": 1.0595312535762786,
"reward_std": 0.15864457711577415,
"rewards/reward_accuracy/mean": 0.96015625,
"rewards/reward_accuracy/std": 0.1561991810798645,
"rewards/reward_format/mean": 0.09937500059604645,
"rewards/reward_format/std": 0.0045710423495620486,
"sampling/importance_sampling_ratio/max": 2.582355499267578,
"sampling/importance_sampling_ratio/mean": 0.9829286515712738,
"sampling/importance_sampling_ratio/min": 0.06416480354964733,
"sampling/sampling_logp_difference/max": 1.0201361656188965,
"sampling/sampling_logp_difference/mean": 0.0042577971471473575,
"step": 6910,
"step_time": 7.499621879585902
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 4.218713229420246e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.218713229420246e-06,
"completions/clipped_ratio": 0.01328125,
"completions/max_length": 1752.5,
"completions/max_terminated_length": 1594.3,
"completions/mean_length": 198.680859375,
"completions/mean_terminated_length": 173.93779602050782,
"completions/min_length": 61.4,
"completions/min_terminated_length": 61.4,
"entropy": 0.05856590850744396,
"epoch": 14.817987152034261,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.283203125,
"learning_rate": 9.308100000000002e-06,
"loss": -0.0095,
"num_tokens": 718767659.0,
"reward": 1.0412695467472077,
"reward_std": 0.21267313584685327,
"rewards/reward_accuracy/mean": 0.9421875,
"rewards/reward_accuracy/std": 0.20965168699622155,
"rewards/reward_format/mean": 0.09908203184604644,
"rewards/reward_format/std": 0.006734621408395469,
"sampling/importance_sampling_ratio/max": 2.337042820453644,
"sampling/importance_sampling_ratio/mean": 0.9630387306213379,
"sampling/importance_sampling_ratio/min": 0.07172191813588143,
"sampling/sampling_logp_difference/max": 1.482088303565979,
"sampling/sampling_logp_difference/mean": 0.004217699752189219,
"step": 6920,
"step_time": 8.662817791194538
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1150.1,
"completions/max_terminated_length": 1049.5,
"completions/mean_length": 164.715625,
"completions/mean_terminated_length": 159.65038452148437,
"completions/min_length": 68.2,
"completions/min_terminated_length": 68.2,
"entropy": 0.047930567129515114,
"epoch": 14.839400428265524,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.0,
"learning_rate": 9.307100000000001e-06,
"loss": -0.0089,
"num_tokens": 719707251.0,
"reward": 1.063730502128601,
"reward_std": 0.14432359337806702,
"rewards/reward_accuracy/mean": 0.9640625,
"rewards/reward_accuracy/std": 0.14294391945004464,
"rewards/reward_format/mean": 0.09966797009110451,
"rewards/reward_format/std": 0.003089072764851153,
"sampling/importance_sampling_ratio/max": 2.4416210412979127,
"sampling/importance_sampling_ratio/mean": 0.9772298991680145,
"sampling/importance_sampling_ratio/min": 0.10648121535778046,
"sampling/sampling_logp_difference/max": 0.8414790272712708,
"sampling/sampling_logp_difference/mean": 0.004202272836118936,
"step": 6930,
"step_time": 5.662771793900174
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.010546875,
"completions/max_length": 1348.8,
"completions/max_terminated_length": 1256.2,
"completions/mean_length": 184.986328125,
"completions/mean_terminated_length": 165.51337890625,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.049998812912963334,
"epoch": 14.860813704496788,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.6328125,
"learning_rate": 9.3061e-06,
"loss": -0.0031,
"num_tokens": 720698896.0,
"reward": 1.0401562809944154,
"reward_std": 0.1960241176187992,
"rewards/reward_accuracy/mean": 0.941015625,
"rewards/reward_accuracy/std": 0.19418873265385628,
"rewards/reward_format/mean": 0.09914062693715095,
"rewards/reward_format/std": 0.005257561942562461,
"sampling/importance_sampling_ratio/max": 2.523267221450806,
"sampling/importance_sampling_ratio/mean": 0.9836653709411621,
"sampling/importance_sampling_ratio/min": 0.16600602567195893,
"sampling/sampling_logp_difference/max": 0.9210699498653412,
"sampling/sampling_logp_difference/mean": 0.003837446542456746,
"step": 6940,
"step_time": 6.834408964891918
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1254.8,
"completions/max_terminated_length": 1180.1,
"completions/mean_length": 164.115625,
"completions/mean_terminated_length": 154.6317352294922,
"completions/min_length": 66.4,
"completions/min_terminated_length": 66.4,
"entropy": 0.049765473767183724,
"epoch": 14.882226980728051,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.2041015625,
"learning_rate": 9.3051e-06,
"loss": -0.0069,
"num_tokens": 721632264.0,
"reward": 1.0456445574760438,
"reward_std": 0.20791090577840804,
"rewards/reward_accuracy/mean": 0.94609375,
"rewards/reward_accuracy/std": 0.20636386722326278,
"rewards/reward_format/mean": 0.09955078214406968,
"rewards/reward_format/std": 0.003733869385905564,
"sampling/importance_sampling_ratio/max": 2.5162373304367067,
"sampling/importance_sampling_ratio/mean": 0.9866890072822571,
"sampling/importance_sampling_ratio/min": 0.19599893614649772,
"sampling/sampling_logp_difference/max": 0.8081388592720031,
"sampling/sampling_logp_difference/mean": 0.00412679030559957,
"step": 6950,
"step_time": 6.018181031901622
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1302.0,
"completions/max_terminated_length": 1135.4,
"completions/mean_length": 167.32890625,
"completions/mean_terminated_length": 156.3629409790039,
"completions/min_length": 67.4,
"completions/min_terminated_length": 67.4,
"entropy": 0.052457149513065814,
"epoch": 14.903640256959315,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.2451171875,
"learning_rate": 9.3041e-06,
"loss": -0.0047,
"num_tokens": 722576322.0,
"reward": 1.0509765803813935,
"reward_std": 0.1524946168065071,
"rewards/reward_accuracy/mean": 0.9515625,
"rewards/reward_accuracy/std": 0.15025750994682313,
"rewards/reward_format/mean": 0.09941406399011612,
"rewards/reward_format/std": 0.005224736337549984,
"sampling/importance_sampling_ratio/max": 2.469403862953186,
"sampling/importance_sampling_ratio/mean": 0.9733265995979309,
"sampling/importance_sampling_ratio/min": 0.17779694721102715,
"sampling/sampling_logp_difference/max": 0.995378029346466,
"sampling/sampling_logp_difference/mean": 0.004421074618585407,
"step": 6960,
"step_time": 6.406590378595865
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.011328125,
"completions/max_length": 1694.6,
"completions/max_terminated_length": 1372.1,
"completions/mean_length": 184.8109375,
"completions/mean_terminated_length": 163.73745040893556,
"completions/min_length": 69.6,
"completions/min_terminated_length": 69.6,
"entropy": 0.05184603310190141,
"epoch": 14.925053533190578,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.154296875,
"learning_rate": 9.3031e-06,
"loss": -0.0009,
"num_tokens": 723571998.0,
"reward": 1.0423047125339509,
"reward_std": 0.20992266461253167,
"rewards/reward_accuracy/mean": 0.943359375,
"rewards/reward_accuracy/std": 0.20608996450901032,
"rewards/reward_format/mean": 0.09894531294703483,
"rewards/reward_format/std": 0.007921843277290463,
"sampling/importance_sampling_ratio/max": 2.4508008480072023,
"sampling/importance_sampling_ratio/mean": 0.9726531744003296,
"sampling/importance_sampling_ratio/min": 0.06938181854784489,
"sampling/sampling_logp_difference/max": 0.9340942025184631,
"sampling/sampling_logp_difference/mean": 0.004172221221961081,
"step": 6970,
"step_time": 8.46364116849145
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1560.3,
"completions/max_terminated_length": 1060.6,
"completions/mean_length": 169.25859375,
"completions/mean_terminated_length": 159.80970916748046,
"completions/min_length": 67.7,
"completions/min_terminated_length": 67.7,
"entropy": 0.050724564422853294,
"epoch": 14.946466809421842,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.2578125,
"learning_rate": 9.3021e-06,
"loss": -0.0049,
"num_tokens": 724521892.0,
"reward": 1.0468359589576721,
"reward_std": 0.19379420801997185,
"rewards/reward_accuracy/mean": 0.947265625,
"rewards/reward_accuracy/std": 0.19200569912791252,
"rewards/reward_format/mean": 0.09957031309604644,
"rewards/reward_format/std": 0.00472977957688272,
"sampling/importance_sampling_ratio/max": 2.4263622999191283,
"sampling/importance_sampling_ratio/mean": 0.9787682950496673,
"sampling/importance_sampling_ratio/min": 0.14150940403342246,
"sampling/sampling_logp_difference/max": 0.8894036054611206,
"sampling/sampling_logp_difference/mean": 0.004207684099674225,
"step": 6980,
"step_time": 7.456690014290507
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012109375,
"completions/max_length": 1259.3,
"completions/max_terminated_length": 1136.7,
"completions/mean_length": 172.162109375,
"completions/mean_terminated_length": 149.67171325683594,
"completions/min_length": 62.8,
"completions/min_terminated_length": 62.8,
"entropy": 0.05063201270531863,
"epoch": 14.967880085653105,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.130859375,
"learning_rate": 9.301100000000001e-06,
"loss": -0.0126,
"num_tokens": 725479651.0,
"reward": 1.061796885728836,
"reward_std": 0.14739519730210304,
"rewards/reward_accuracy/mean": 0.962890625,
"rewards/reward_accuracy/std": 0.1440330721437931,
"rewards/reward_format/mean": 0.09890625029802322,
"rewards/reward_format/std": 0.004262604913674295,
"sampling/importance_sampling_ratio/max": 2.4646072506904604,
"sampling/importance_sampling_ratio/mean": 0.9782161056995392,
"sampling/importance_sampling_ratio/min": 0.09269896261394024,
"sampling/sampling_logp_difference/max": 0.8845544695854187,
"sampling/sampling_logp_difference/mean": 0.004151504789479077,
"step": 6990,
"step_time": 6.406637724285247
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1422.7,
"completions/max_terminated_length": 1162.5,
"completions/mean_length": 175.2484375,
"completions/mean_terminated_length": 158.4126754760742,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.05517679611220956,
"epoch": 14.989293361884368,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.267578125,
"learning_rate": 9.300100000000001e-06,
"loss": -0.0187,
"num_tokens": 726448735.0,
"reward": 1.0540625333786011,
"reward_std": 0.17826180458068847,
"rewards/reward_accuracy/mean": 0.9546875,
"rewards/reward_accuracy/std": 0.17551805153489114,
"rewards/reward_format/mean": 0.09937500208616257,
"rewards/reward_format/std": 0.0050549020525068045,
"sampling/importance_sampling_ratio/max": 2.6001256823539736,
"sampling/importance_sampling_ratio/mean": 0.9950046300888061,
"sampling/importance_sampling_ratio/min": 0.10333430608734488,
"sampling/sampling_logp_difference/max": 0.9480283737182618,
"sampling/sampling_logp_difference/mean": 0.004263513907790184,
"step": 7000,
"step_time": 6.947675809694919
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1479.3,
"completions/max_terminated_length": 1385.5,
"completions/mean_length": 152.048046875,
"completions/mean_terminated_length": 147.67642517089843,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.04377060746774077,
"epoch": 15.010706638115632,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.298828125,
"learning_rate": 9.2991e-06,
"loss": -0.0122,
"num_tokens": 727351098.0,
"reward": 1.068847692012787,
"reward_std": 0.13495956510305404,
"rewards/reward_accuracy/mean": 0.969140625,
"rewards/reward_accuracy/std": 0.1338830128312111,
"rewards/reward_format/mean": 0.09970703348517418,
"rewards/reward_format/std": 0.002646519849076867,
"sampling/importance_sampling_ratio/max": 2.3728976011276246,
"sampling/importance_sampling_ratio/mean": 0.9925214767456054,
"sampling/importance_sampling_ratio/min": 0.15332801546901464,
"sampling/sampling_logp_difference/max": 0.978899359703064,
"sampling/sampling_logp_difference/mean": 0.00390852652490139,
"step": 7010,
"step_time": 7.069137014690204
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1187.0,
"completions/max_terminated_length": 1042.5,
"completions/mean_length": 158.3203125,
"completions/mean_terminated_length": 151.09336700439454,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.04392353205475956,
"epoch": 15.032119914346895,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.10595703125,
"learning_rate": 9.298100000000002e-06,
"loss": -0.0034,
"num_tokens": 728273902.0,
"reward": 1.060898447036743,
"reward_std": 0.13938554227352143,
"rewards/reward_accuracy/mean": 0.961328125,
"rewards/reward_accuracy/std": 0.13785515651106833,
"rewards/reward_format/mean": 0.09957031384110451,
"rewards/reward_format/std": 0.0034344091545790434,
"sampling/importance_sampling_ratio/max": 2.609756660461426,
"sampling/importance_sampling_ratio/mean": 0.9871224820613861,
"sampling/importance_sampling_ratio/min": 0.21139651760458947,
"sampling/sampling_logp_difference/max": 0.9376499235630036,
"sampling/sampling_logp_difference/mean": 0.003827275149524212,
"step": 7020,
"step_time": 5.893394995000563
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1275.0,
"completions/max_terminated_length": 1134.0,
"completions/mean_length": 164.88984375,
"completions/mean_terminated_length": 159.8415496826172,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.04841146576218307,
"epoch": 15.05353319057816,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.0,
"learning_rate": 9.297100000000001e-06,
"loss": -0.0118,
"num_tokens": 729214308.0,
"reward": 1.0384570598602294,
"reward_std": 0.19093629121780395,
"rewards/reward_accuracy/mean": 0.938671875,
"rewards/reward_accuracy/std": 0.19029095619916916,
"rewards/reward_format/mean": 0.09978515729308128,
"rewards/reward_format/std": 0.0023854749975726008,
"sampling/importance_sampling_ratio/max": 2.5343018531799317,
"sampling/importance_sampling_ratio/mean": 0.9798329591751098,
"sampling/importance_sampling_ratio/min": 0.11001985780894756,
"sampling/sampling_logp_difference/max": 0.9716536283493042,
"sampling/sampling_logp_difference/mean": 0.004281904618255794,
"step": 7030,
"step_time": 6.216698204504792
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1636.2,
"completions/max_terminated_length": 1288.7,
"completions/mean_length": 174.783984375,
"completions/mean_terminated_length": 163.11656341552734,
"completions/min_length": 62.5,
"completions/min_terminated_length": 62.5,
"entropy": 0.05513442165683955,
"epoch": 15.074946466809422,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.5390625,
"learning_rate": 9.2961e-06,
"loss": -0.0058,
"num_tokens": 730184251.0,
"reward": 1.060410165786743,
"reward_std": 0.17317760214209557,
"rewards/reward_accuracy/mean": 0.9609375,
"rewards/reward_accuracy/std": 0.17056833133101462,
"rewards/reward_format/mean": 0.09947265610098839,
"rewards/reward_format/std": 0.005417351028881967,
"sampling/importance_sampling_ratio/max": 2.6028765439987183,
"sampling/importance_sampling_ratio/mean": 0.9830532193183898,
"sampling/importance_sampling_ratio/min": 0.1183671735227108,
"sampling/sampling_logp_difference/max": 0.9968079447746276,
"sampling/sampling_logp_difference/mean": 0.0045206229202449325,
"step": 7040,
"step_time": 7.878791802196065
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1280.1,
"completions/max_terminated_length": 1215.6,
"completions/mean_length": 160.591796875,
"completions/mean_terminated_length": 154.8308868408203,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.0474294290645048,
"epoch": 15.096359743040685,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.498046875,
"learning_rate": 9.2951e-06,
"loss": -0.0055,
"num_tokens": 731107430.0,
"reward": 1.0504101753234862,
"reward_std": 0.1587141551077366,
"rewards/reward_accuracy/mean": 0.95078125,
"rewards/reward_accuracy/std": 0.1576414167881012,
"rewards/reward_format/mean": 0.09962890669703484,
"rewards/reward_format/std": 0.003290347219444811,
"sampling/importance_sampling_ratio/max": 2.381807041168213,
"sampling/importance_sampling_ratio/mean": 0.9935790538787842,
"sampling/importance_sampling_ratio/min": 0.18346887044608592,
"sampling/sampling_logp_difference/max": 0.8020280063152313,
"sampling/sampling_logp_difference/mean": 0.004237801721319556,
"step": 7050,
"step_time": 6.343988282603095
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1661.9,
"completions/max_terminated_length": 1467.0,
"completions/mean_length": 180.41640625,
"completions/mean_terminated_length": 169.48878021240233,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"entropy": 0.05385971521027386,
"epoch": 15.117773019271949,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.18359375,
"learning_rate": 9.2941e-06,
"loss": -0.0064,
"num_tokens": 732091904.0,
"reward": 1.0300000131130218,
"reward_std": 0.21643896996974946,
"rewards/reward_accuracy/mean": 0.93046875,
"rewards/reward_accuracy/std": 0.21463593393564223,
"rewards/reward_format/mean": 0.09953125044703484,
"rewards/reward_format/std": 0.004288564575836063,
"sampling/importance_sampling_ratio/max": 2.507221531867981,
"sampling/importance_sampling_ratio/mean": 0.9931994140148163,
"sampling/importance_sampling_ratio/min": 0.09779414632357657,
"sampling/sampling_logp_difference/max": 1.0071120381355285,
"sampling/sampling_logp_difference/mean": 0.00430749305523932,
"step": 7060,
"step_time": 8.159795534599107
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1890.5,
"completions/max_terminated_length": 1609.5,
"completions/mean_length": 167.444140625,
"completions/mean_terminated_length": 157.86988067626953,
"completions/min_length": 67.9,
"completions/min_terminated_length": 67.9,
"entropy": 0.04781922153197229,
"epoch": 15.139186295503212,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.486328125,
"learning_rate": 9.293100000000001e-06,
"loss": -0.0093,
"num_tokens": 733037521.0,
"reward": 1.0669921934604645,
"reward_std": 0.15988533347845077,
"rewards/reward_accuracy/mean": 0.967578125,
"rewards/reward_accuracy/std": 0.15655581429600715,
"rewards/reward_format/mean": 0.09941406399011612,
"rewards/reward_format/std": 0.00637006398756057,
"sampling/importance_sampling_ratio/max": 2.685281205177307,
"sampling/importance_sampling_ratio/mean": 0.9929550945758819,
"sampling/importance_sampling_ratio/min": 0.08799112662672996,
"sampling/sampling_logp_difference/max": 0.9770249545574188,
"sampling/sampling_logp_difference/mean": 0.004301597457379102,
"step": 7070,
"step_time": 8.887216113394242
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1752.7,
"completions/max_terminated_length": 1379.6,
"completions/mean_length": 174.14375,
"completions/mean_terminated_length": 164.65306243896484,
"completions/min_length": 61.9,
"completions/min_terminated_length": 61.9,
"entropy": 0.052217196812853216,
"epoch": 15.160599571734476,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.47265625,
"learning_rate": 9.2921e-06,
"loss": -0.0092,
"num_tokens": 734005985.0,
"reward": 1.050664085149765,
"reward_std": 0.18426819145679474,
"rewards/reward_accuracy/mean": 0.951171875,
"rewards/reward_accuracy/std": 0.18196085169911386,
"rewards/reward_format/mean": 0.0994921900331974,
"rewards/reward_format/std": 0.005565527617000044,
"sampling/importance_sampling_ratio/max": 2.4482095718383787,
"sampling/importance_sampling_ratio/mean": 0.9863419651985168,
"sampling/importance_sampling_ratio/min": 0.0424001894891262,
"sampling/sampling_logp_difference/max": 0.9047368764877319,
"sampling/sampling_logp_difference/mean": 0.004326129984110594,
"step": 7080,
"step_time": 8.235323837515898
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1379.4,
"completions/max_terminated_length": 1190.7,
"completions/mean_length": 161.51953125,
"completions/mean_terminated_length": 154.16651458740233,
"completions/min_length": 65.6,
"completions/min_terminated_length": 65.6,
"entropy": 0.045991945639252664,
"epoch": 15.182012847965739,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.5234375,
"learning_rate": 9.2911e-06,
"loss": -0.004,
"num_tokens": 734934739.0,
"reward": 1.058613306283951,
"reward_std": 0.15692218393087387,
"rewards/reward_accuracy/mean": 0.958984375,
"rewards/reward_accuracy/std": 0.15548494309186936,
"rewards/reward_format/mean": 0.09962890818715095,
"rewards/reward_format/std": 0.0039509717840701345,
"sampling/importance_sampling_ratio/max": 2.4033055543899535,
"sampling/importance_sampling_ratio/mean": 0.9886721014976502,
"sampling/importance_sampling_ratio/min": 0.14339804518967866,
"sampling/sampling_logp_difference/max": 1.1173086047172547,
"sampling/sampling_logp_difference/mean": 0.0040568567113950845,
"step": 7090,
"step_time": 6.759345568303251
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1321.1,
"completions/max_terminated_length": 929.8,
"completions/mean_length": 156.040625,
"completions/mean_terminated_length": 148.69303283691406,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"entropy": 0.04601462753489614,
"epoch": 15.203426124197001,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.0,
"learning_rate": 9.290100000000001e-06,
"loss": -0.0035,
"num_tokens": 735843627.0,
"reward": 1.0434570550918578,
"reward_std": 0.18292034193873405,
"rewards/reward_accuracy/mean": 0.94375,
"rewards/reward_accuracy/std": 0.18124310448765754,
"rewards/reward_format/mean": 0.09970703274011612,
"rewards/reward_format/std": 0.0033390013268217444,
"sampling/importance_sampling_ratio/max": 2.4161807894706726,
"sampling/importance_sampling_ratio/mean": 0.990520441532135,
"sampling/importance_sampling_ratio/min": 0.08764507174491883,
"sampling/sampling_logp_difference/max": 0.949564266204834,
"sampling/sampling_logp_difference/mean": 0.004205293790437281,
"step": 7100,
"step_time": 6.326194966211915
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1385.6,
"completions/max_terminated_length": 1025.8,
"completions/mean_length": 149.7140625,
"completions/mean_terminated_length": 146.0130630493164,
"completions/min_length": 63.7,
"completions/min_terminated_length": 63.7,
"entropy": 0.04210801017470658,
"epoch": 15.224839400428266,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.158203125,
"learning_rate": 9.2891e-06,
"loss": -0.0009,
"num_tokens": 736741583.0,
"reward": 1.063476574420929,
"reward_std": 0.1515470723854378,
"rewards/reward_accuracy/mean": 0.963671875,
"rewards/reward_accuracy/std": 0.15024069249629973,
"rewards/reward_format/mean": 0.0998046875,
"rewards/reward_format/std": 0.0023282783571630717,
"sampling/importance_sampling_ratio/max": 2.4754985928535462,
"sampling/importance_sampling_ratio/mean": 0.9936016082763672,
"sampling/importance_sampling_ratio/min": 0.18255412993021308,
"sampling/sampling_logp_difference/max": 0.8553207576274872,
"sampling/sampling_logp_difference/mean": 0.003890295117162168,
"step": 7110,
"step_time": 6.517715397902066
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1225.3,
"completions/max_terminated_length": 1063.4,
"completions/mean_length": 151.100390625,
"completions/mean_terminated_length": 143.7102249145508,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.04442235855385661,
"epoch": 15.246252676659529,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.1455078125,
"learning_rate": 9.288100000000002e-06,
"loss": 0.0006,
"num_tokens": 737643792.0,
"reward": 1.0774218797683717,
"reward_std": 0.12939444705843925,
"rewards/reward_accuracy/mean": 0.977734375,
"rewards/reward_accuracy/std": 0.12736781910061837,
"rewards/reward_format/mean": 0.09968750029802323,
"rewards/reward_format/std": 0.003136378456838429,
"sampling/importance_sampling_ratio/max": 2.270175075531006,
"sampling/importance_sampling_ratio/mean": 0.9810038566589355,
"sampling/importance_sampling_ratio/min": 0.1359750010073185,
"sampling/sampling_logp_difference/max": 1.1350075721740722,
"sampling/sampling_logp_difference/mean": 0.004018250922672451,
"step": 7120,
"step_time": 6.144538417304284
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1740.2,
"completions/max_terminated_length": 1542.2,
"completions/mean_length": 187.9078125,
"completions/mean_terminated_length": 171.87345275878906,
"completions/min_length": 67.8,
"completions/min_terminated_length": 67.8,
"entropy": 0.0553223718656227,
"epoch": 15.267665952890793,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.1494140625,
"learning_rate": 9.287100000000001e-06,
"loss": -0.0093,
"num_tokens": 738644596.0,
"reward": 1.0465820550918579,
"reward_std": 0.20307109355926514,
"rewards/reward_accuracy/mean": 0.947265625,
"rewards/reward_accuracy/std": 0.2005542039871216,
"rewards/reward_format/mean": 0.09931640848517417,
"rewards/reward_format/std": 0.005809655506163835,
"sampling/importance_sampling_ratio/max": 2.4885475754737856,
"sampling/importance_sampling_ratio/mean": 0.9805585384368897,
"sampling/importance_sampling_ratio/min": 0.06283389553427696,
"sampling/sampling_logp_difference/max": 0.8790978908538818,
"sampling/sampling_logp_difference/mean": 0.004365371074527502,
"step": 7130,
"step_time": 8.349189929696148
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1672.4,
"completions/max_terminated_length": 1571.7,
"completions/mean_length": 171.075390625,
"completions/mean_terminated_length": 158.59072723388672,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.05066291000694036,
"epoch": 15.289079229122056,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.0732421875,
"learning_rate": 9.2861e-06,
"loss": -0.0088,
"num_tokens": 739597493.0,
"reward": 1.0411133170127869,
"reward_std": 0.21928545087575912,
"rewards/reward_accuracy/mean": 0.941796875,
"rewards/reward_accuracy/std": 0.21701414063572882,
"rewards/reward_format/mean": 0.09931640848517417,
"rewards/reward_format/std": 0.005614688131026923,
"sampling/importance_sampling_ratio/max": 2.3813472986221313,
"sampling/importance_sampling_ratio/mean": 0.9923224091529846,
"sampling/importance_sampling_ratio/min": 0.07906158193945885,
"sampling/sampling_logp_difference/max": 0.9743347644805909,
"sampling/sampling_logp_difference/mean": 0.00431519178673625,
"step": 7140,
"step_time": 8.117679375308217
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 816.7,
"completions/max_terminated_length": 816.7,
"completions/mean_length": 148.15,
"completions/mean_terminated_length": 148.15,
"completions/min_length": 68.1,
"completions/min_terminated_length": 68.1,
"entropy": 0.04116584658622742,
"epoch": 15.310492505353318,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.0,
"learning_rate": 9.2851e-06,
"loss": -0.0028,
"num_tokens": 740495429.0,
"reward": 1.053886741399765,
"reward_std": 0.15682606920599937,
"rewards/reward_accuracy/mean": 0.95390625,
"rewards/reward_accuracy/std": 0.15678301379084586,
"rewards/reward_format/mean": 0.09998046979308128,
"rewards/reward_format/std": 0.0003125000046566129,
"sampling/importance_sampling_ratio/max": 2.4022382736206054,
"sampling/importance_sampling_ratio/mean": 0.9966201543807983,
"sampling/importance_sampling_ratio/min": 0.22219525277614594,
"sampling/sampling_logp_difference/max": 0.831229853630066,
"sampling/sampling_logp_difference/mean": 0.0039053149288520218,
"step": 7150,
"step_time": 4.165067574122804
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1440.3,
"completions/max_terminated_length": 1212.6,
"completions/mean_length": 158.1046875,
"completions/mean_terminated_length": 147.8651565551758,
"completions/min_length": 62.8,
"completions/min_terminated_length": 62.8,
"entropy": 0.04496923265978694,
"epoch": 15.331905781584583,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.0,
"learning_rate": 9.2841e-06,
"loss": -0.0023,
"num_tokens": 741416241.0,
"reward": 1.063554698228836,
"reward_std": 0.13689906373620034,
"rewards/reward_accuracy/mean": 0.9640625,
"rewards/reward_accuracy/std": 0.1342928372323513,
"rewards/reward_format/mean": 0.09949218854308128,
"rewards/reward_format/std": 0.004393647401593625,
"sampling/importance_sampling_ratio/max": 2.3695493221282957,
"sampling/importance_sampling_ratio/mean": 0.993875014781952,
"sampling/importance_sampling_ratio/min": 0.16959349098615348,
"sampling/sampling_logp_difference/max": 0.8064995765686035,
"sampling/sampling_logp_difference/mean": 0.003776929946616292,
"step": 7160,
"step_time": 7.117355005998979
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1327.1,
"completions/max_terminated_length": 1158.7,
"completions/mean_length": 167.53984375,
"completions/mean_terminated_length": 152.1641067504883,
"completions/min_length": 66.3,
"completions/min_terminated_length": 66.3,
"entropy": 0.048627977073192594,
"epoch": 15.353319057815845,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0,
"learning_rate": 9.283100000000001e-06,
"loss": -0.0042,
"num_tokens": 742353735.0,
"reward": 1.0587304890155793,
"reward_std": 0.15393975302577018,
"rewards/reward_accuracy/mean": 0.959375,
"rewards/reward_accuracy/std": 0.15123281702399255,
"rewards/reward_format/mean": 0.09935547113418579,
"rewards/reward_format/std": 0.005542309954762459,
"sampling/importance_sampling_ratio/max": 2.5531511306762695,
"sampling/importance_sampling_ratio/mean": 0.973378711938858,
"sampling/importance_sampling_ratio/min": 0.11491879522800445,
"sampling/sampling_logp_difference/max": 1.0520840644836427,
"sampling/sampling_logp_difference/mean": 0.004118624213151634,
"step": 7170,
"step_time": 6.774140313599491
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.374415791768115e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.374415791768115e-06,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1644.0,
"completions/max_terminated_length": 1488.6,
"completions/mean_length": 172.978515625,
"completions/mean_terminated_length": 158.37812347412108,
"completions/min_length": 67.5,
"completions/min_terminated_length": 67.5,
"entropy": 0.05405530002899468,
"epoch": 15.37473233404711,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.318359375,
"learning_rate": 9.2821e-06,
"loss": -0.0115,
"num_tokens": 743317760.0,
"reward": 1.060937511920929,
"reward_std": 0.17899244502186776,
"rewards/reward_accuracy/mean": 0.96171875,
"rewards/reward_accuracy/std": 0.1757420100271702,
"rewards/reward_format/mean": 0.09921875074505807,
"rewards/reward_format/std": 0.005246018106117844,
"sampling/importance_sampling_ratio/max": 2.374092531204224,
"sampling/importance_sampling_ratio/mean": 0.983341532945633,
"sampling/importance_sampling_ratio/min": 0.0426672600209713,
"sampling/sampling_logp_difference/max": 1.023732453584671,
"sampling/sampling_logp_difference/mean": 0.004382954374887049,
"step": 7180,
"step_time": 7.976757635499235
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1746.2,
"completions/max_terminated_length": 1650.5,
"completions/mean_length": 172.156640625,
"completions/mean_terminated_length": 161.22746887207032,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.05257654085289687,
"epoch": 15.396145610278372,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.306640625,
"learning_rate": 9.2811e-06,
"loss": -0.0121,
"num_tokens": 744281377.0,
"reward": 1.0529102027416228,
"reward_std": 0.1947343997657299,
"rewards/reward_accuracy/mean": 0.953515625,
"rewards/reward_accuracy/std": 0.19262249991297722,
"rewards/reward_format/mean": 0.09939453303813935,
"rewards/reward_format/std": 0.005345711065456271,
"sampling/importance_sampling_ratio/max": 2.3413537621498106,
"sampling/importance_sampling_ratio/mean": 0.9703140020370483,
"sampling/importance_sampling_ratio/min": 0.08746642097830773,
"sampling/sampling_logp_difference/max": 1.0109641671180725,
"sampling/sampling_logp_difference/mean": 0.004156707227230072,
"step": 7190,
"step_time": 8.291111761608045
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1667.6,
"completions/max_terminated_length": 1430.5,
"completions/mean_length": 169.57109375,
"completions/mean_terminated_length": 163.6954605102539,
"completions/min_length": 66.4,
"completions/min_terminated_length": 66.4,
"entropy": 0.04977785828523338,
"epoch": 15.417558886509635,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.65625,
"learning_rate": 9.280100000000001e-06,
"loss": -0.0023,
"num_tokens": 745235959.0,
"reward": 1.0516992568969727,
"reward_std": 0.18766923248767853,
"rewards/reward_accuracy/mean": 0.951953125,
"rewards/reward_accuracy/std": 0.1860370934009552,
"rewards/reward_format/mean": 0.0997460961341858,
"rewards/reward_format/std": 0.002958945953287184,
"sampling/importance_sampling_ratio/max": 2.5951329588890077,
"sampling/importance_sampling_ratio/mean": 0.995012491941452,
"sampling/importance_sampling_ratio/min": 0.10028434917330742,
"sampling/sampling_logp_difference/max": 0.9405996084213257,
"sampling/sampling_logp_difference/mean": 0.004281873209401965,
"step": 7200,
"step_time": 7.854155952698784
},
{
"clip_ratio/high_max": 8.745335799176246e-06,
"clip_ratio/high_mean": 1.0931669748970308e-06,
"clip_ratio/low_mean": 1.997686831600731e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.090853806497762e-06,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1405.5,
"completions/max_terminated_length": 1284.6,
"completions/mean_length": 186.208203125,
"completions/mean_terminated_length": 168.1266662597656,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.056118366145528856,
"epoch": 15.4389721627409,
"frac_reward_zero_std": 0.84375,
"grad_norm": 0.341796875,
"learning_rate": 9.2791e-06,
"loss": -0.011,
"num_tokens": 746230284.0,
"reward": 1.0449414372444152,
"reward_std": 0.19201430380344392,
"rewards/reward_accuracy/mean": 0.945703125,
"rewards/reward_accuracy/std": 0.18951964974403382,
"rewards/reward_format/mean": 0.0992382824420929,
"rewards/reward_format/std": 0.004761925409547984,
"sampling/importance_sampling_ratio/max": 2.438070523738861,
"sampling/importance_sampling_ratio/mean": 0.9825598895549774,
"sampling/importance_sampling_ratio/min": 0.1317385310307145,
"sampling/sampling_logp_difference/max": 0.9088634729385376,
"sampling/sampling_logp_difference/mean": 0.0043797560036182405,
"step": 7210,
"step_time": 7.200625032989774
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1361.4,
"completions/max_terminated_length": 1190.0,
"completions/mean_length": 157.655859375,
"completions/mean_terminated_length": 150.2948028564453,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.047929273056797686,
"epoch": 15.460385438972162,
"frac_reward_zero_std": 0.90625,
"grad_norm": 1.3203125,
"learning_rate": 9.2781e-06,
"loss": 0.003,
"num_tokens": 747151387.0,
"reward": 1.0620703220367431,
"reward_std": 0.14231131374835967,
"rewards/reward_accuracy/mean": 0.9625,
"rewards/reward_accuracy/std": 0.14060111194849015,
"rewards/reward_format/mean": 0.09957031309604644,
"rewards/reward_format/std": 0.004069638275541365,
"sampling/importance_sampling_ratio/max": 2.647476243972778,
"sampling/importance_sampling_ratio/mean": 0.9884066998958587,
"sampling/importance_sampling_ratio/min": 0.082749018445611,
"sampling/sampling_logp_difference/max": 1.0341296911239624,
"sampling/sampling_logp_difference/mean": 0.004404998989775777,
"step": 7220,
"step_time": 6.809988783512381
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1600.2,
"completions/max_terminated_length": 1150.7,
"completions/mean_length": 175.2265625,
"completions/mean_terminated_length": 163.53193359375,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.05002381606027484,
"epoch": 15.481798715203427,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.443359375,
"learning_rate": 9.277100000000001e-06,
"loss": -0.0039,
"num_tokens": 748121647.0,
"reward": 1.0622851848602295,
"reward_std": 0.16346621364355088,
"rewards/reward_accuracy/mean": 0.962890625,
"rewards/reward_accuracy/std": 0.16027154698967933,
"rewards/reward_format/mean": 0.09939453303813935,
"rewards/reward_format/std": 0.00502528939396143,
"sampling/importance_sampling_ratio/max": 2.412003147602081,
"sampling/importance_sampling_ratio/mean": 0.9843259990215302,
"sampling/importance_sampling_ratio/min": 0.08627275638282299,
"sampling/sampling_logp_difference/max": 0.9702064275741578,
"sampling/sampling_logp_difference/mean": 0.004116731369867921,
"step": 7230,
"step_time": 7.6888663478079255
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1572.1,
"completions/max_terminated_length": 1195.7,
"completions/mean_length": 174.78984375,
"completions/mean_terminated_length": 159.41939239501954,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.05504837026819587,
"epoch": 15.50321199143469,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.2236328125,
"learning_rate": 9.276100000000001e-06,
"loss": -0.0131,
"num_tokens": 749088005.0,
"reward": 1.0562500476837158,
"reward_std": 0.16944995298981666,
"rewards/reward_accuracy/mean": 0.95703125,
"rewards/reward_accuracy/std": 0.16618905290961267,
"rewards/reward_format/mean": 0.09921875149011612,
"rewards/reward_format/std": 0.005859295115806162,
"sampling/importance_sampling_ratio/max": 2.3586599946022035,
"sampling/importance_sampling_ratio/mean": 0.972951990365982,
"sampling/importance_sampling_ratio/min": 0.09580017775297164,
"sampling/sampling_logp_difference/max": 1.0596708476543426,
"sampling/sampling_logp_difference/mean": 0.004440417443402111,
"step": 7240,
"step_time": 7.662646519596455
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1295.6,
"completions/max_terminated_length": 1026.7,
"completions/mean_length": 147.518359375,
"completions/mean_terminated_length": 145.29415740966797,
"completions/min_length": 68.5,
"completions/min_terminated_length": 68.5,
"entropy": 0.04318873505108058,
"epoch": 15.524625267665954,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0908203125,
"learning_rate": 9.2751e-06,
"loss": -0.003,
"num_tokens": 749979956.0,
"reward": 1.079199230670929,
"reward_std": 0.1209317035973072,
"rewards/reward_accuracy/mean": 0.979296875,
"rewards/reward_accuracy/std": 0.12016067951917649,
"rewards/reward_format/mean": 0.09990234449505805,
"rewards/reward_format/std": 0.001562500116415322,
"sampling/importance_sampling_ratio/max": 2.4705662727355957,
"sampling/importance_sampling_ratio/mean": 0.9823544263839722,
"sampling/importance_sampling_ratio/min": 0.1446947030723095,
"sampling/sampling_logp_difference/max": 1.329058861732483,
"sampling/sampling_logp_difference/mean": 0.003963357582688331,
"step": 7250,
"step_time": 6.272284038088401
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1435.5,
"completions/max_terminated_length": 1121.2,
"completions/mean_length": 172.802734375,
"completions/mean_terminated_length": 160.38688049316406,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"entropy": 0.05012706976849586,
"epoch": 15.546038543897216,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.25,
"learning_rate": 9.2741e-06,
"loss": -0.0068,
"num_tokens": 750945355.0,
"reward": 1.0530468940734863,
"reward_std": 0.1761208787560463,
"rewards/reward_accuracy/mean": 0.953515625,
"rewards/reward_accuracy/std": 0.17386947572231293,
"rewards/reward_format/mean": 0.0995312511920929,
"rewards/reward_format/std": 0.004662298248149455,
"sampling/importance_sampling_ratio/max": 2.501370596885681,
"sampling/importance_sampling_ratio/mean": 0.9947784841060638,
"sampling/importance_sampling_ratio/min": 0.18348529767245053,
"sampling/sampling_logp_difference/max": 0.8495087623596191,
"sampling/sampling_logp_difference/mean": 0.00430142164696008,
"step": 7260,
"step_time": 7.014399127499201
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.4505368199024816e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.4505368199024816e-06,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1324.7,
"completions/max_terminated_length": 1025.7,
"completions/mean_length": 164.978515625,
"completions/mean_terminated_length": 153.41284637451173,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.052918220730498435,
"epoch": 15.567451820128479,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.283203125,
"learning_rate": 9.273100000000001e-06,
"loss": -0.0047,
"num_tokens": 751887620.0,
"reward": 1.0506250321865083,
"reward_std": 0.17252187207341194,
"rewards/reward_accuracy/mean": 0.951171875,
"rewards/reward_accuracy/std": 0.17011184468865395,
"rewards/reward_format/mean": 0.09945312589406967,
"rewards/reward_format/std": 0.004875409998930991,
"sampling/importance_sampling_ratio/max": 2.4037542581558227,
"sampling/importance_sampling_ratio/mean": 0.9920016407966614,
"sampling/importance_sampling_ratio/min": 0.18870468772947788,
"sampling/sampling_logp_difference/max": 1.0364430904388429,
"sampling/sampling_logp_difference/mean": 0.004301556199789047,
"step": 7270,
"step_time": 6.503339134625276
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1625.4,
"completions/max_terminated_length": 1487.7,
"completions/mean_length": 160.966015625,
"completions/mean_terminated_length": 153.63013458251953,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.048980147438123824,
"epoch": 15.588865096359743,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.1416015625,
"learning_rate": 9.2721e-06,
"loss": -0.0082,
"num_tokens": 752817245.0,
"reward": 1.0450390696525573,
"reward_std": 0.20467463210225106,
"rewards/reward_accuracy/mean": 0.9453125,
"rewards/reward_accuracy/std": 0.20361437425017356,
"rewards/reward_format/mean": 0.09972656294703483,
"rewards/reward_format/std": 0.002877799631096423,
"sampling/importance_sampling_ratio/max": 2.382560110092163,
"sampling/importance_sampling_ratio/mean": 0.9875393271446228,
"sampling/importance_sampling_ratio/min": 0.1976780690252781,
"sampling/sampling_logp_difference/max": 0.9786213755607605,
"sampling/sampling_logp_difference/mean": 0.004234943236224353,
"step": 7280,
"step_time": 7.760058836609824
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1840.1,
"completions/max_terminated_length": 1452.7,
"completions/mean_length": 180.07734375,
"completions/mean_terminated_length": 164.75896759033202,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.05303023040760309,
"epoch": 15.610278372591006,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.078125,
"learning_rate": 9.2711e-06,
"loss": -0.0125,
"num_tokens": 753797091.0,
"reward": 1.0504687666893004,
"reward_std": 0.19500854462385178,
"rewards/reward_accuracy/mean": 0.951171875,
"rewards/reward_accuracy/std": 0.1919720560312271,
"rewards/reward_format/mean": 0.09929687678813934,
"rewards/reward_format/std": 0.006277910876087844,
"sampling/importance_sampling_ratio/max": 2.5350603342056273,
"sampling/importance_sampling_ratio/mean": 0.9812662303447723,
"sampling/importance_sampling_ratio/min": 0.12728011943399906,
"sampling/sampling_logp_difference/max": 0.9052463412284851,
"sampling/sampling_logp_difference/mean": 0.004289478273130953,
"step": 7290,
"step_time": 8.729826466203667
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1279.4,
"completions/max_terminated_length": 959.1,
"completions/mean_length": 157.8453125,
"completions/mean_terminated_length": 149.83285064697264,
"completions/min_length": 62.0,
"completions/min_terminated_length": 62.0,
"entropy": 0.04895356763154268,
"epoch": 15.63169164882227,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.0,
"learning_rate": 9.270100000000001e-06,
"loss": -0.0004,
"num_tokens": 754715815.0,
"reward": 1.0458984613418578,
"reward_std": 0.1804988756775856,
"rewards/reward_accuracy/mean": 0.94609375,
"rewards/reward_accuracy/std": 0.17942741885781288,
"rewards/reward_format/mean": 0.09980468899011612,
"rewards/reward_format/std": 0.0024868135806173086,
"sampling/importance_sampling_ratio/max": 2.3851242899894713,
"sampling/importance_sampling_ratio/mean": 0.9787418007850647,
"sampling/importance_sampling_ratio/min": 0.1544072486460209,
"sampling/sampling_logp_difference/max": 0.7701907992362976,
"sampling/sampling_logp_difference/mean": 0.004176755528897047,
"step": 7300,
"step_time": 6.247145386898774
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1784.5,
"completions/max_terminated_length": 1572.9,
"completions/mean_length": 179.412109375,
"completions/mean_terminated_length": 167.83583374023436,
"completions/min_length": 60.9,
"completions/min_terminated_length": 60.9,
"entropy": 0.057583738747052846,
"epoch": 15.653104925053533,
"frac_reward_zero_std": 0.84375,
"grad_norm": 0.404296875,
"learning_rate": 9.2691e-06,
"loss": -0.0145,
"num_tokens": 755693318.0,
"reward": 1.0369922041893005,
"reward_std": 0.21723022907972336,
"rewards/reward_accuracy/mean": 0.9375,
"rewards/reward_accuracy/std": 0.2149900861084461,
"rewards/reward_format/mean": 0.09949218779802323,
"rewards/reward_format/std": 0.005285822134464979,
"sampling/importance_sampling_ratio/max": 2.548732006549835,
"sampling/importance_sampling_ratio/mean": 0.9871122419834137,
"sampling/importance_sampling_ratio/min": 0.060354103613644836,
"sampling/sampling_logp_difference/max": 1.0017538785934448,
"sampling/sampling_logp_difference/mean": 0.004709430364891886,
"step": 7310,
"step_time": 8.455897053898662
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1477.9,
"completions/max_terminated_length": 1380.2,
"completions/mean_length": 194.72421875,
"completions/mean_terminated_length": 180.57219848632812,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.05504522793926299,
"epoch": 15.674518201284796,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.439453125,
"learning_rate": 9.2681e-06,
"loss": -0.0053,
"num_tokens": 756713700.0,
"reward": 1.0622265696525575,
"reward_std": 0.17378995269536973,
"rewards/reward_accuracy/mean": 0.962890625,
"rewards/reward_accuracy/std": 0.171462781727314,
"rewards/reward_format/mean": 0.0993359386920929,
"rewards/reward_format/std": 0.0045016798423603175,
"sampling/importance_sampling_ratio/max": 2.4595836400985718,
"sampling/importance_sampling_ratio/mean": 0.9896947562694549,
"sampling/importance_sampling_ratio/min": 0.12447053864598275,
"sampling/sampling_logp_difference/max": 0.9323425769805909,
"sampling/sampling_logp_difference/mean": 0.004179598693735897,
"step": 7320,
"step_time": 7.416681460686959
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1506.1,
"completions/max_terminated_length": 1341.9,
"completions/mean_length": 181.344140625,
"completions/mean_terminated_length": 164.69799041748047,
"completions/min_length": 68.8,
"completions/min_terminated_length": 68.8,
"entropy": 0.0563886137213558,
"epoch": 15.69593147751606,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.0,
"learning_rate": 9.267100000000001e-06,
"loss": -0.0104,
"num_tokens": 757701957.0,
"reward": 1.0609375357627868,
"reward_std": 0.17294201403856277,
"rewards/reward_accuracy/mean": 0.96171875,
"rewards/reward_accuracy/std": 0.16988052502274514,
"rewards/reward_format/mean": 0.09921875223517418,
"rewards/reward_format/std": 0.005146918911486864,
"sampling/importance_sampling_ratio/max": 2.400870203971863,
"sampling/importance_sampling_ratio/mean": 0.9871320962905884,
"sampling/importance_sampling_ratio/min": 0.11139190793037415,
"sampling/sampling_logp_difference/max": 1.0247216939926147,
"sampling/sampling_logp_difference/mean": 0.004380368557758629,
"step": 7330,
"step_time": 7.508020689393743
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1727.8,
"completions/max_terminated_length": 1379.5,
"completions/mean_length": 164.379296875,
"completions/mean_terminated_length": 153.39752349853515,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.048242447129450736,
"epoch": 15.717344753747323,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.1806640625,
"learning_rate": 9.266100000000001e-06,
"loss": -0.0105,
"num_tokens": 758639856.0,
"reward": 1.0666406333446503,
"reward_std": 0.15610856637358667,
"rewards/reward_accuracy/mean": 0.9671875,
"rewards/reward_accuracy/std": 0.15333698838949203,
"rewards/reward_format/mean": 0.09945312589406967,
"rewards/reward_format/std": 0.004781407583504915,
"sampling/importance_sampling_ratio/max": 2.5371954917907713,
"sampling/importance_sampling_ratio/mean": 0.9838827788829804,
"sampling/importance_sampling_ratio/min": 0.05228218324482441,
"sampling/sampling_logp_difference/max": 1.0979979038238525,
"sampling/sampling_logp_difference/mean": 0.0041676952969282866,
"step": 7340,
"step_time": 8.053445617985563
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1258.6,
"completions/max_terminated_length": 975.3,
"completions/mean_length": 161.751171875,
"completions/mean_terminated_length": 155.16514434814454,
"completions/min_length": 62.7,
"completions/min_terminated_length": 62.7,
"entropy": 0.046681685652583835,
"epoch": 15.738758029978587,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.0,
"learning_rate": 9.2651e-06,
"loss": -0.0073,
"num_tokens": 759572339.0,
"reward": 1.0673437774181367,
"reward_std": 0.147407615929842,
"rewards/reward_accuracy/mean": 0.967578125,
"rewards/reward_accuracy/std": 0.14612978249788283,
"rewards/reward_format/mean": 0.09976562708616257,
"rewards/reward_format/std": 0.003014297503978014,
"sampling/importance_sampling_ratio/max": 2.3487537145614623,
"sampling/importance_sampling_ratio/mean": 0.995146781206131,
"sampling/importance_sampling_ratio/min": 0.09163826368749142,
"sampling/sampling_logp_difference/max": 1.02916179895401,
"sampling/sampling_logp_difference/mean": 0.004048635205253959,
"step": 7350,
"step_time": 6.110323378999601
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1321.8,
"completions/max_terminated_length": 928.3,
"completions/mean_length": 165.188671875,
"completions/mean_terminated_length": 160.08337860107423,
"completions/min_length": 71.1,
"completions/min_terminated_length": 71.1,
"entropy": 0.04954493457917124,
"epoch": 15.76017130620985,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.44140625,
"learning_rate": 9.2641e-06,
"loss": -0.0031,
"num_tokens": 760522086.0,
"reward": 1.076230490207672,
"reward_std": 0.12541281282901764,
"rewards/reward_accuracy/mean": 0.9765625,
"rewards/reward_accuracy/std": 0.12367122620344162,
"rewards/reward_format/mean": 0.09966797009110451,
"rewards/reward_format/std": 0.003710146341472864,
"sampling/importance_sampling_ratio/max": 2.5150890588760375,
"sampling/importance_sampling_ratio/mean": 0.9849582254886627,
"sampling/importance_sampling_ratio/min": 0.12283427491784096,
"sampling/sampling_logp_difference/max": 0.930587911605835,
"sampling/sampling_logp_difference/mean": 0.004190472909249366,
"step": 7360,
"step_time": 6.498671458184253
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1835.8,
"completions/max_terminated_length": 1489.0,
"completions/mean_length": 182.462109375,
"completions/mean_terminated_length": 163.4350212097168,
"completions/min_length": 69.8,
"completions/min_terminated_length": 69.8,
"entropy": 0.0526542134815827,
"epoch": 15.781584582441113,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.5625,
"learning_rate": 9.263100000000001e-06,
"loss": -0.0076,
"num_tokens": 761514613.0,
"reward": 1.040214866399765,
"reward_std": 0.22741349712014197,
"rewards/reward_accuracy/mean": 0.941015625,
"rewards/reward_accuracy/std": 0.2238510586321354,
"rewards/reward_format/mean": 0.09919921979308129,
"rewards/reward_format/std": 0.007575070136226714,
"sampling/importance_sampling_ratio/max": 2.4173116087913513,
"sampling/importance_sampling_ratio/mean": 0.9858577847480774,
"sampling/importance_sampling_ratio/min": 0.043523166328668594,
"sampling/sampling_logp_difference/max": 0.9800334274768829,
"sampling/sampling_logp_difference/mean": 0.0043530965922400355,
"step": 7370,
"step_time": 8.791602441295982
},
{
"clip_ratio/high_max": 8.263552444986999e-06,
"clip_ratio/high_mean": 1.0329440556233749e-06,
"clip_ratio/low_mean": 2.0862024257439772e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.119146481367352e-06,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1402.8,
"completions/max_terminated_length": 1110.0,
"completions/mean_length": 158.46640625,
"completions/mean_terminated_length": 147.3747589111328,
"completions/min_length": 68.2,
"completions/min_terminated_length": 68.2,
"entropy": 0.04591957794036716,
"epoch": 15.802997858672377,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.150390625,
"learning_rate": 9.2621e-06,
"loss": 0.0013,
"num_tokens": 762439343.0,
"reward": 1.0783984661102295,
"reward_std": 0.12236752957105637,
"rewards/reward_accuracy/mean": 0.97890625,
"rewards/reward_accuracy/std": 0.12006175220012665,
"rewards/reward_format/mean": 0.09949218928813934,
"rewards/reward_format/std": 0.003631688980385661,
"sampling/importance_sampling_ratio/max": 2.472250282764435,
"sampling/importance_sampling_ratio/mean": 0.995585960149765,
"sampling/importance_sampling_ratio/min": 0.16178351547569036,
"sampling/sampling_logp_difference/max": 0.8116357445716857,
"sampling/sampling_logp_difference/mean": 0.004083652887493372,
"step": 7380,
"step_time": 6.856907191404025
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1243.4,
"completions/max_terminated_length": 1181.5,
"completions/mean_length": 168.2953125,
"completions/mean_terminated_length": 158.87424011230468,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.05008279194589704,
"epoch": 15.82441113490364,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.2421875,
"learning_rate": 9.2611e-06,
"loss": -0.0095,
"num_tokens": 763385939.0,
"reward": 1.053515648841858,
"reward_std": 0.17563808783888818,
"rewards/reward_accuracy/mean": 0.95390625,
"rewards/reward_accuracy/std": 0.17462463453412055,
"rewards/reward_format/mean": 0.09960937649011611,
"rewards/reward_format/std": 0.003153076791204512,
"sampling/importance_sampling_ratio/max": 2.583732557296753,
"sampling/importance_sampling_ratio/mean": 0.9832672834396362,
"sampling/importance_sampling_ratio/min": 0.17304082065820695,
"sampling/sampling_logp_difference/max": 0.8502934813499451,
"sampling/sampling_logp_difference/mean": 0.004105702671222389,
"step": 7390,
"step_time": 6.401839357192512
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1589.2,
"completions/max_terminated_length": 1282.2,
"completions/mean_length": 166.7609375,
"completions/mean_terminated_length": 149.0612045288086,
"completions/min_length": 60.7,
"completions/min_terminated_length": 60.7,
"entropy": 0.051198167237453164,
"epoch": 15.845824411134904,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.30859375,
"learning_rate": 9.260100000000001e-06,
"loss": -0.0083,
"num_tokens": 764327183.0,
"reward": 1.0633008003234863,
"reward_std": 0.1610859252512455,
"rewards/reward_accuracy/mean": 0.9640625,
"rewards/reward_accuracy/std": 0.15735794231295586,
"rewards/reward_format/mean": 0.0992382824420929,
"rewards/reward_format/std": 0.006124604842625558,
"sampling/importance_sampling_ratio/max": 2.587886595726013,
"sampling/importance_sampling_ratio/mean": 0.9940712571144104,
"sampling/importance_sampling_ratio/min": 0.08026873879134655,
"sampling/sampling_logp_difference/max": 0.9524994730949402,
"sampling/sampling_logp_difference/mean": 0.004300723318010569,
"step": 7400,
"step_time": 7.499492890518741
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1626.8,
"completions/max_terminated_length": 1480.4,
"completions/mean_length": 181.815234375,
"completions/mean_terminated_length": 168.73580780029297,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.06327865575440228,
"epoch": 15.867237687366167,
"frac_reward_zero_std": 0.84375,
"grad_norm": 0.0595703125,
"learning_rate": 9.259100000000001e-06,
"loss": -0.0062,
"num_tokens": 765306598.0,
"reward": 1.0622656226158143,
"reward_std": 0.16165482476353646,
"rewards/reward_accuracy/mean": 0.962890625,
"rewards/reward_accuracy/std": 0.15915471762418748,
"rewards/reward_format/mean": 0.09937499985098838,
"rewards/reward_format/std": 0.00478698976803571,
"sampling/importance_sampling_ratio/max": 2.502791738510132,
"sampling/importance_sampling_ratio/mean": 0.9951833367347718,
"sampling/importance_sampling_ratio/min": 0.10305047379806638,
"sampling/sampling_logp_difference/max": 0.8406207740306855,
"sampling/sampling_logp_difference/mean": 0.0046466160099953415,
"step": 7410,
"step_time": 7.966698476721649
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1909.8,
"completions/max_terminated_length": 1760.8,
"completions/mean_length": 187.52421875,
"completions/mean_terminated_length": 173.8340087890625,
"completions/min_length": 64.4,
"completions/min_terminated_length": 64.4,
"entropy": 0.05872277743183076,
"epoch": 15.888650963597431,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.10986328125,
"learning_rate": 9.2581e-06,
"loss": 0.0013,
"num_tokens": 766305620.0,
"reward": 1.0431250095367433,
"reward_std": 0.2114048719406128,
"rewards/reward_accuracy/mean": 0.94375,
"rewards/reward_accuracy/std": 0.20945394709706305,
"rewards/reward_format/mean": 0.09937499985098838,
"rewards/reward_format/std": 0.005236491980031133,
"sampling/importance_sampling_ratio/max": 2.4600640892982484,
"sampling/importance_sampling_ratio/mean": 0.9891933679580689,
"sampling/importance_sampling_ratio/min": 0.08572614938020706,
"sampling/sampling_logp_difference/max": 0.8218006491661072,
"sampling/sampling_logp_difference/mean": 0.004449196788482368,
"step": 7420,
"step_time": 9.396801085793413
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.010546875,
"completions/max_length": 1618.8,
"completions/max_terminated_length": 1385.3,
"completions/mean_length": 191.5578125,
"completions/mean_terminated_length": 171.98495025634764,
"completions/min_length": 66.5,
"completions/min_terminated_length": 66.5,
"entropy": 0.056943182437680664,
"epoch": 15.910064239828694,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.271484375,
"learning_rate": 9.257100000000002e-06,
"loss": -0.0058,
"num_tokens": 767319448.0,
"reward": 1.0506445586681366,
"reward_std": 0.18098186552524567,
"rewards/reward_accuracy/mean": 0.9515625,
"rewards/reward_accuracy/std": 0.1780993312597275,
"rewards/reward_format/mean": 0.09908203259110451,
"rewards/reward_format/std": 0.005972184706479311,
"sampling/importance_sampling_ratio/max": 2.563217115402222,
"sampling/importance_sampling_ratio/mean": 0.9909120857715606,
"sampling/importance_sampling_ratio/min": 0.06259623914957047,
"sampling/sampling_logp_difference/max": 0.9620221793651581,
"sampling/sampling_logp_difference/mean": 0.00447903429158032,
"step": 7430,
"step_time": 7.7941959843941735
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.7698987221592689e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.7698987221592689e-06,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1490.1,
"completions/max_terminated_length": 1100.4,
"completions/mean_length": 170.518359375,
"completions/mean_terminated_length": 155.06661529541014,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.04709431999363005,
"epoch": 15.931477516059957,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.279296875,
"learning_rate": 9.256100000000001e-06,
"loss": -0.0006,
"num_tokens": 768272983.0,
"reward": 1.0676367282867432,
"reward_std": 0.15943209901452066,
"rewards/reward_accuracy/mean": 0.968359375,
"rewards/reward_accuracy/std": 0.15570439398288727,
"rewards/reward_format/mean": 0.09927734434604644,
"rewards/reward_format/std": 0.005679406528361142,
"sampling/importance_sampling_ratio/max": 2.486377000808716,
"sampling/importance_sampling_ratio/mean": 0.9915073871612549,
"sampling/importance_sampling_ratio/min": 0.1411423236131668,
"sampling/sampling_logp_difference/max": 0.8282851099967956,
"sampling/sampling_logp_difference/mean": 0.004278757050633431,
"step": 7440,
"step_time": 7.263933133799583
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1380.4,
"completions/max_terminated_length": 1126.5,
"completions/mean_length": 175.905078125,
"completions/mean_terminated_length": 158.95009155273436,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.04751935868989676,
"epoch": 15.952890792291221,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.0,
"learning_rate": 9.2551e-06,
"loss": -0.0081,
"num_tokens": 769236692.0,
"reward": 1.0552929759025573,
"reward_std": 0.17346298694610596,
"rewards/reward_accuracy/mean": 0.95625,
"rewards/reward_accuracy/std": 0.17020985707640648,
"rewards/reward_format/mean": 0.0990429699420929,
"rewards/reward_format/std": 0.005760164908133447,
"sampling/importance_sampling_ratio/max": 2.3760067343711855,
"sampling/importance_sampling_ratio/mean": 0.9794980049133301,
"sampling/importance_sampling_ratio/min": 0.12560493126511574,
"sampling/sampling_logp_difference/max": 0.8790980160236359,
"sampling/sampling_logp_difference/mean": 0.003991183917969465,
"step": 7450,
"step_time": 6.909343643797911
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1262.0,
"completions/max_terminated_length": 993.2,
"completions/mean_length": 156.930078125,
"completions/mean_terminated_length": 147.31487426757812,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.043808518908917904,
"epoch": 15.974304068522484,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.28515625,
"learning_rate": 9.2541e-06,
"loss": -0.003,
"num_tokens": 770151825.0,
"reward": 1.077011728286743,
"reward_std": 0.11716569289565086,
"rewards/reward_accuracy/mean": 0.97734375,
"rewards/reward_accuracy/std": 0.11516818180680274,
"rewards/reward_format/mean": 0.09966796934604645,
"rewards/reward_format/std": 0.0035057181725278498,
"sampling/importance_sampling_ratio/max": 2.378123605251312,
"sampling/importance_sampling_ratio/mean": 0.9865248918533325,
"sampling/importance_sampling_ratio/min": 0.14279377982020378,
"sampling/sampling_logp_difference/max": 0.918242585659027,
"sampling/sampling_logp_difference/mean": 0.0037846090272068977,
"step": 7460,
"step_time": 6.054634008815628
},
{
"clip_ratio/high_max": 4.982140089850873e-05,
"clip_ratio/high_mean": 6.227675112313591e-06,
"clip_ratio/low_mean": 4.278336746210698e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.0506011676625349e-05,
"completions/clipped_ratio": 0.010546875,
"completions/max_length": 1457.5,
"completions/max_terminated_length": 1304.8,
"completions/mean_length": 176.266796875,
"completions/mean_terminated_length": 156.27637176513673,
"completions/min_length": 67.1,
"completions/min_terminated_length": 67.1,
"entropy": 0.0524467988172546,
"epoch": 15.995717344753746,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 9.253100000000001e-06,
"loss": -0.0068,
"num_tokens": 771120108.0,
"reward": 1.0624609470367432,
"reward_std": 0.16595850735902787,
"rewards/reward_accuracy/mean": 0.96328125,
"rewards/reward_accuracy/std": 0.16222340539097785,
"rewards/reward_format/mean": 0.09917968809604645,
"rewards/reward_format/std": 0.005845137080177665,
"sampling/importance_sampling_ratio/max": 2.511593687534332,
"sampling/importance_sampling_ratio/mean": 0.9895595788955689,
"sampling/importance_sampling_ratio/min": 0.0943706750869751,
"sampling/sampling_logp_difference/max": 1.030219304561615,
"sampling/sampling_logp_difference/mean": 0.0043052863096818324,
"step": 7470,
"step_time": 7.213760881006602
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1845.3,
"completions/max_terminated_length": 1597.6,
"completions/mean_length": 190.14453125,
"completions/mean_terminated_length": 171.2102478027344,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.05759809457231313,
"epoch": 16.01713062098501,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.1943359375,
"learning_rate": 9.2521e-06,
"loss": -0.0123,
"num_tokens": 772118622.0,
"reward": 1.0379296958446502,
"reward_std": 0.21699898242950438,
"rewards/reward_accuracy/mean": 0.938671875,
"rewards/reward_accuracy/std": 0.21391298323869706,
"rewards/reward_format/mean": 0.09925781413912774,
"rewards/reward_format/std": 0.006568579142913223,
"sampling/importance_sampling_ratio/max": 2.3930506229400637,
"sampling/importance_sampling_ratio/mean": 0.9692868530750275,
"sampling/importance_sampling_ratio/min": 0.10342595875263214,
"sampling/sampling_logp_difference/max": 1.506835389137268,
"sampling/sampling_logp_difference/mean": 0.004451815411448479,
"step": 7480,
"step_time": 8.91149079160823
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1520.6,
"completions/max_terminated_length": 1318.5,
"completions/mean_length": 161.258984375,
"completions/mean_terminated_length": 155.37012329101563,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.044545961706899104,
"epoch": 16.038543897216275,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.349609375,
"learning_rate": 9.2511e-06,
"loss": -0.0041,
"num_tokens": 773049397.0,
"reward": 1.0348047018051147,
"reward_std": 0.21688670217990874,
"rewards/reward_accuracy/mean": 0.93515625,
"rewards/reward_accuracy/std": 0.21565750986337662,
"rewards/reward_format/mean": 0.09964843839406967,
"rewards/reward_format/std": 0.003941558417864144,
"sampling/importance_sampling_ratio/max": 2.51152925491333,
"sampling/importance_sampling_ratio/mean": 0.9991677582263947,
"sampling/importance_sampling_ratio/min": 0.1307633062824607,
"sampling/sampling_logp_difference/max": 1.0547487795352937,
"sampling/sampling_logp_difference/mean": 0.00425048943143338,
"step": 7490,
"step_time": 7.216543937302776
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1567.2,
"completions/max_terminated_length": 1450.4,
"completions/mean_length": 177.590625,
"completions/mean_terminated_length": 166.0336898803711,
"completions/min_length": 68.2,
"completions/min_terminated_length": 68.2,
"entropy": 0.04887575029861182,
"epoch": 16.059957173447536,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.408203125,
"learning_rate": 9.250100000000001e-06,
"loss": -0.0024,
"num_tokens": 774024653.0,
"reward": 1.0643164396286011,
"reward_std": 0.16549836993217468,
"rewards/reward_accuracy/mean": 0.96484375,
"rewards/reward_accuracy/std": 0.16345215439796448,
"rewards/reward_format/mean": 0.0994726575911045,
"rewards/reward_format/std": 0.004842052469030023,
"sampling/importance_sampling_ratio/max": 2.512472367286682,
"sampling/importance_sampling_ratio/mean": 0.9861550688743591,
"sampling/importance_sampling_ratio/min": 0.11974570155143738,
"sampling/sampling_logp_difference/max": 1.1895613074302673,
"sampling/sampling_logp_difference/mean": 0.003974211122840643,
"step": 7500,
"step_time": 7.617511435915366
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1338.4,
"completions/max_terminated_length": 1198.8,
"completions/mean_length": 170.492578125,
"completions/mean_terminated_length": 157.3934356689453,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.050892702862620355,
"epoch": 16.0813704496788,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.474609375,
"learning_rate": 9.249100000000001e-06,
"loss": -0.0049,
"num_tokens": 774976234.0,
"reward": 1.0475390672683715,
"reward_std": 0.19675918519496918,
"rewards/reward_accuracy/mean": 0.948046875,
"rewards/reward_accuracy/std": 0.1951913096010685,
"rewards/reward_format/mean": 0.09949218779802323,
"rewards/reward_format/std": 0.003920315811410546,
"sampling/importance_sampling_ratio/max": 2.4574202060699464,
"sampling/importance_sampling_ratio/mean": 0.9992922782897949,
"sampling/importance_sampling_ratio/min": 0.12658161371946336,
"sampling/sampling_logp_difference/max": 1.043505895137787,
"sampling/sampling_logp_difference/mean": 0.0043189430609345434,
"step": 7510,
"step_time": 6.783111018591444
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1515.9,
"completions/max_terminated_length": 1317.9,
"completions/mean_length": 170.589453125,
"completions/mean_terminated_length": 157.46135864257812,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.05594647685065866,
"epoch": 16.102783725910065,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.388671875,
"learning_rate": 9.2481e-06,
"loss": -0.0089,
"num_tokens": 775924511.0,
"reward": 1.0634961009025574,
"reward_std": 0.16605668216943742,
"rewards/reward_accuracy/mean": 0.9640625,
"rewards/reward_accuracy/std": 0.16380197778344155,
"rewards/reward_format/mean": 0.09943359419703483,
"rewards/reward_format/std": 0.0056073881918564435,
"sampling/importance_sampling_ratio/max": 2.5513537883758546,
"sampling/importance_sampling_ratio/mean": 0.9813665568828582,
"sampling/importance_sampling_ratio/min": 0.1272606797516346,
"sampling/sampling_logp_difference/max": 0.851073157787323,
"sampling/sampling_logp_difference/mean": 0.0044221748830750585,
"step": 7520,
"step_time": 7.410155645405757
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1657.1,
"completions/max_terminated_length": 1538.6,
"completions/mean_length": 176.751171875,
"completions/mean_terminated_length": 160.73704223632814,
"completions/min_length": 61.9,
"completions/min_terminated_length": 61.9,
"entropy": 0.04543398518580943,
"epoch": 16.124197002141326,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.78125,
"learning_rate": 9.247100000000002e-06,
"loss": -0.0089,
"num_tokens": 776892994.0,
"reward": 1.0581445455551148,
"reward_std": 0.18210460469126702,
"rewards/reward_accuracy/mean": 0.958984375,
"rewards/reward_accuracy/std": 0.17887890189886094,
"rewards/reward_format/mean": 0.09916015788912773,
"rewards/reward_format/std": 0.0051536925137043,
"sampling/importance_sampling_ratio/max": 2.4916744470596313,
"sampling/importance_sampling_ratio/mean": 0.9836355686187744,
"sampling/importance_sampling_ratio/min": 0.0206426277756691,
"sampling/sampling_logp_difference/max": 1.1121335089206696,
"sampling/sampling_logp_difference/mean": 0.0040432780515402555,
"step": 7530,
"step_time": 8.069660441836458
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 955.8,
"completions/max_terminated_length": 837.9,
"completions/mean_length": 143.26171875,
"completions/mean_terminated_length": 135.89168701171874,
"completions/min_length": 60.7,
"completions/min_terminated_length": 60.7,
"entropy": 0.036901535792276265,
"epoch": 16.14561027837259,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.0,
"learning_rate": 9.246100000000001e-06,
"loss": 0.0024,
"num_tokens": 777767632.0,
"reward": 1.0704101920127869,
"reward_std": 0.1214959517121315,
"rewards/reward_accuracy/mean": 0.970703125,
"rewards/reward_accuracy/std": 0.12033451646566391,
"rewards/reward_format/mean": 0.09970703348517418,
"rewards/reward_format/std": 0.002822448266670108,
"sampling/importance_sampling_ratio/max": 2.129604470729828,
"sampling/importance_sampling_ratio/mean": 0.9820225536823273,
"sampling/importance_sampling_ratio/min": 0.17182854088023305,
"sampling/sampling_logp_difference/max": 1.0559695839881897,
"sampling/sampling_logp_difference/mean": 0.003541051596403122,
"step": 7540,
"step_time": 5.068485534196952
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1375.1,
"completions/max_terminated_length": 1231.9,
"completions/mean_length": 168.176953125,
"completions/mean_terminated_length": 154.96715698242187,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.04824209045618773,
"epoch": 16.167023554603855,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.302734375,
"learning_rate": 9.2451e-06,
"loss": -0.0056,
"num_tokens": 778714725.0,
"reward": 1.0622851610183717,
"reward_std": 0.1558469869196415,
"rewards/reward_accuracy/mean": 0.962890625,
"rewards/reward_accuracy/std": 0.15340813174843787,
"rewards/reward_format/mean": 0.09939453154802322,
"rewards/reward_format/std": 0.004454098083078862,
"sampling/importance_sampling_ratio/max": 2.360276222229004,
"sampling/importance_sampling_ratio/mean": 0.9861403107643127,
"sampling/importance_sampling_ratio/min": 0.12866153568029404,
"sampling/sampling_logp_difference/max": 1.167552924156189,
"sampling/sampling_logp_difference/mean": 0.004010846582241356,
"step": 7550,
"step_time": 6.890104783093557
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1259.2,
"completions/max_terminated_length": 1060.5,
"completions/mean_length": 169.84140625,
"completions/mean_terminated_length": 166.9798355102539,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.04674338719341904,
"epoch": 16.18843683083512,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.55078125,
"learning_rate": 9.2441e-06,
"loss": -0.0074,
"num_tokens": 779669615.0,
"reward": 1.066230481863022,
"reward_std": 0.1451662741601467,
"rewards/reward_accuracy/mean": 0.96640625,
"rewards/reward_accuracy/std": 0.14432501196861267,
"rewards/reward_format/mean": 0.0998242199420929,
"rewards/reward_format/std": 0.0023254600586369635,
"sampling/importance_sampling_ratio/max": 2.4781846046447753,
"sampling/importance_sampling_ratio/mean": 0.9777596414089202,
"sampling/importance_sampling_ratio/min": 0.10589946806430817,
"sampling/sampling_logp_difference/max": 1.1525016903877259,
"sampling/sampling_logp_difference/mean": 0.004027322237379849,
"step": 7560,
"step_time": 6.091077825700632
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1534.8,
"completions/max_terminated_length": 1423.1,
"completions/mean_length": 180.208984375,
"completions/mean_terminated_length": 172.3422073364258,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.048767938860692084,
"epoch": 16.20985010706638,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.43359375,
"learning_rate": 9.2431e-06,
"loss": 0.0002,
"num_tokens": 780649974.0,
"reward": 1.056621116399765,
"reward_std": 0.17865685373544693,
"rewards/reward_accuracy/mean": 0.95703125,
"rewards/reward_accuracy/std": 0.17723799049854277,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.003935943846590817,
"sampling/importance_sampling_ratio/max": 2.5164379358291624,
"sampling/importance_sampling_ratio/mean": 0.9811029314994812,
"sampling/importance_sampling_ratio/min": 0.05014926940202713,
"sampling/sampling_logp_difference/max": 0.9963155686855316,
"sampling/sampling_logp_difference/mean": 0.004142227536067367,
"step": 7570,
"step_time": 7.496756882604677
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1533.7,
"completions/max_terminated_length": 1432.2,
"completions/mean_length": 184.312890625,
"completions/mean_terminated_length": 172.24881744384766,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.059445186494849624,
"epoch": 16.231263383297645,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.1689453125,
"learning_rate": 9.2421e-06,
"loss": -0.0045,
"num_tokens": 781641559.0,
"reward": 1.0482617378234864,
"reward_std": 0.18036468997597693,
"rewards/reward_accuracy/mean": 0.948828125,
"rewards/reward_accuracy/std": 0.1791354276239872,
"rewards/reward_format/mean": 0.09943359494209289,
"rewards/reward_format/std": 0.003223245334811509,
"sampling/importance_sampling_ratio/max": 2.5627302289009095,
"sampling/importance_sampling_ratio/mean": 0.9729063153266907,
"sampling/importance_sampling_ratio/min": 0.12622721195220948,
"sampling/sampling_logp_difference/max": 0.9489181518554688,
"sampling/sampling_logp_difference/mean": 0.004606791539117694,
"step": 7580,
"step_time": 7.5197388113010675
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1859.7,
"completions/max_terminated_length": 1559.5,
"completions/mean_length": 192.3453125,
"completions/mean_terminated_length": 169.30025329589844,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.05911666764877736,
"epoch": 16.25267665952891,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.55859375,
"learning_rate": 9.2411e-06,
"loss": -0.0129,
"num_tokens": 782652747.0,
"reward": 1.0407812595367432,
"reward_std": 0.2180221512913704,
"rewards/reward_accuracy/mean": 0.941796875,
"rewards/reward_accuracy/std": 0.21496710255742074,
"rewards/reward_format/mean": 0.09898437708616256,
"rewards/reward_format/std": 0.007263506855815649,
"sampling/importance_sampling_ratio/max": 2.4927805185317995,
"sampling/importance_sampling_ratio/mean": 0.9739419400691987,
"sampling/importance_sampling_ratio/min": 0.02291399594396353,
"sampling/sampling_logp_difference/max": 0.8216204106807709,
"sampling/sampling_logp_difference/mean": 0.004711908800527453,
"step": 7590,
"step_time": 8.995428224912029
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.0683374461659698e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.0683374461659698e-06,
"completions/clipped_ratio": 0.011328125,
"completions/max_length": 1449.3,
"completions/max_terminated_length": 1176.9,
"completions/mean_length": 184.8859375,
"completions/mean_terminated_length": 164.10084228515626,
"completions/min_length": 69.4,
"completions/min_terminated_length": 69.4,
"entropy": 0.05352129249367863,
"epoch": 16.27408993576017,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.369140625,
"learning_rate": 9.240100000000002e-06,
"loss": -0.0086,
"num_tokens": 783642455.0,
"reward": 1.0380859613418578,
"reward_std": 0.20728197395801545,
"rewards/reward_accuracy/mean": 0.9390625,
"rewards/reward_accuracy/std": 0.20456125512719153,
"rewards/reward_format/mean": 0.09902343899011612,
"rewards/reward_format/std": 0.006093620299361646,
"sampling/importance_sampling_ratio/max": 2.3876322984695433,
"sampling/importance_sampling_ratio/mean": 0.981217336654663,
"sampling/importance_sampling_ratio/min": 0.1588934175670147,
"sampling/sampling_logp_difference/max": 0.964260995388031,
"sampling/sampling_logp_difference/mean": 0.004306959128007293,
"step": 7600,
"step_time": 7.249025062093279
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 5.590339696937008e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 5.590339696937008e-07,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1498.2,
"completions/max_terminated_length": 1155.3,
"completions/mean_length": 170.191015625,
"completions/mean_terminated_length": 160.04469604492186,
"completions/min_length": 67.6,
"completions/min_terminated_length": 67.6,
"entropy": 0.04924966762773693,
"epoch": 16.295503211991434,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.15625,
"learning_rate": 9.239100000000001e-06,
"loss": -0.0054,
"num_tokens": 784602832.0,
"reward": 1.0633593857288361,
"reward_std": 0.15717458501458167,
"rewards/reward_accuracy/mean": 0.963671875,
"rewards/reward_accuracy/std": 0.15570423379540443,
"rewards/reward_format/mean": 0.09968750104308129,
"rewards/reward_format/std": 0.0032824984518811107,
"sampling/importance_sampling_ratio/max": 2.334762215614319,
"sampling/importance_sampling_ratio/mean": 0.9954739689826966,
"sampling/importance_sampling_ratio/min": 0.12818059455603362,
"sampling/sampling_logp_difference/max": 0.8631705939769745,
"sampling/sampling_logp_difference/mean": 0.004174013645388186,
"step": 7610,
"step_time": 7.3299509002798
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1703.7,
"completions/max_terminated_length": 1307.1,
"completions/mean_length": 172.357421875,
"completions/mean_terminated_length": 162.76832733154296,
"completions/min_length": 67.5,
"completions/min_terminated_length": 67.5,
"entropy": 0.05531854196451604,
"epoch": 16.3169164882227,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.5234375,
"learning_rate": 9.2381e-06,
"loss": -0.0046,
"num_tokens": 785571939.0,
"reward": 1.065292978286743,
"reward_std": 0.14945287883747368,
"rewards/reward_accuracy/mean": 0.965625,
"rewards/reward_accuracy/std": 0.14725296646356584,
"rewards/reward_format/mean": 0.09966796934604645,
"rewards/reward_format/std": 0.0035795941716060043,
"sampling/importance_sampling_ratio/max": 2.616814112663269,
"sampling/importance_sampling_ratio/mean": 0.9839324295520783,
"sampling/importance_sampling_ratio/min": 0.1239270786754787,
"sampling/sampling_logp_difference/max": 1.0493920564651489,
"sampling/sampling_logp_difference/mean": 0.004632820677943528,
"step": 7620,
"step_time": 7.9969353492895605
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1269.8,
"completions/max_terminated_length": 1128.0,
"completions/mean_length": 153.058984375,
"completions/mean_terminated_length": 150.1091735839844,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.04154078084975481,
"epoch": 16.338329764453963,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.8515625,
"learning_rate": 9.237100000000002e-06,
"loss": -0.0052,
"num_tokens": 786478394.0,
"reward": 1.0720898509025574,
"reward_std": 0.14333806037902833,
"rewards/reward_accuracy/mean": 0.972265625,
"rewards/reward_accuracy/std": 0.14233369156718254,
"rewards/reward_format/mean": 0.09982421919703484,
"rewards/reward_format/std": 0.00257267439737916,
"sampling/importance_sampling_ratio/max": 2.3864935398101808,
"sampling/importance_sampling_ratio/mean": 0.9807554721832276,
"sampling/importance_sampling_ratio/min": 0.13502856194972992,
"sampling/sampling_logp_difference/max": 0.7638950228691102,
"sampling/sampling_logp_difference/mean": 0.003957644826732576,
"step": 7630,
"step_time": 5.995953610501601
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1340.5,
"completions/max_terminated_length": 1228.0,
"completions/mean_length": 182.675,
"completions/mean_terminated_length": 163.88452911376953,
"completions/min_length": 63.7,
"completions/min_terminated_length": 63.7,
"entropy": 0.05099497903138399,
"epoch": 16.359743040685224,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.3984375,
"learning_rate": 9.236100000000001e-06,
"loss": -0.009,
"num_tokens": 787467834.0,
"reward": 1.0584179878234863,
"reward_std": 0.1526952601969242,
"rewards/reward_accuracy/mean": 0.959375,
"rewards/reward_accuracy/std": 0.14928207248449327,
"rewards/reward_format/mean": 0.09904296919703484,
"rewards/reward_format/std": 0.006092970189638436,
"sampling/importance_sampling_ratio/max": 2.373087000846863,
"sampling/importance_sampling_ratio/mean": 0.975908488035202,
"sampling/importance_sampling_ratio/min": 0.1168867040425539,
"sampling/sampling_logp_difference/max": 1.0705070972442627,
"sampling/sampling_logp_difference/mean": 0.004221283481456339,
"step": 7640,
"step_time": 6.835608499500085
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1414.7,
"completions/max_terminated_length": 1181.2,
"completions/mean_length": 169.374609375,
"completions/mean_terminated_length": 160.6475860595703,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.05177610446698964,
"epoch": 16.38115631691649,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.3046875,
"learning_rate": 9.2351e-06,
"loss": -0.0075,
"num_tokens": 788420425.0,
"reward": 1.0700586318969727,
"reward_std": 0.13926267251372337,
"rewards/reward_accuracy/mean": 0.9703125,
"rewards/reward_accuracy/std": 0.13807793483138084,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.002443795278668404,
"sampling/importance_sampling_ratio/max": 2.3778449654579163,
"sampling/importance_sampling_ratio/mean": 0.9877699494361878,
"sampling/importance_sampling_ratio/min": 0.13400082159787416,
"sampling/sampling_logp_difference/max": 1.0405210554599762,
"sampling/sampling_logp_difference/mean": 0.004238462797366083,
"step": 7650,
"step_time": 6.899082937513595
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1554.7,
"completions/max_terminated_length": 1261.0,
"completions/mean_length": 168.283203125,
"completions/mean_terminated_length": 162.45049133300782,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.04644826084841043,
"epoch": 16.402569593147753,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.357421875,
"learning_rate": 9.2341e-06,
"loss": -0.01,
"num_tokens": 789372430.0,
"reward": 1.0603906512260437,
"reward_std": 0.18892464116215707,
"rewards/reward_accuracy/mean": 0.960546875,
"rewards/reward_accuracy/std": 0.1880067139863968,
"rewards/reward_format/mean": 0.09984375163912773,
"rewards/reward_format/std": 0.0019482230301946402,
"sampling/importance_sampling_ratio/max": 2.544890522956848,
"sampling/importance_sampling_ratio/mean": 0.9915287435054779,
"sampling/importance_sampling_ratio/min": 0.04895990882068872,
"sampling/sampling_logp_difference/max": 0.9616687536239624,
"sampling/sampling_logp_difference/mean": 0.004124602722004056,
"step": 7660,
"step_time": 7.299361201183638
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1510.8,
"completions/max_terminated_length": 1229.3,
"completions/mean_length": 164.6,
"completions/mean_terminated_length": 153.60628814697264,
"completions/min_length": 62.9,
"completions/min_terminated_length": 62.9,
"entropy": 0.0490699180169031,
"epoch": 16.423982869379014,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.1767578125,
"learning_rate": 9.2331e-06,
"loss": -0.0099,
"num_tokens": 790309038.0,
"reward": 1.0584765672683716,
"reward_std": 0.17143115103244783,
"rewards/reward_accuracy/mean": 0.958984375,
"rewards/reward_accuracy/std": 0.1691612996160984,
"rewards/reward_format/mean": 0.09949218779802323,
"rewards/reward_format/std": 0.004522916418500245,
"sampling/importance_sampling_ratio/max": 2.257109534740448,
"sampling/importance_sampling_ratio/mean": 0.984152489900589,
"sampling/importance_sampling_ratio/min": 0.0974786639213562,
"sampling/sampling_logp_difference/max": 0.9881892681121827,
"sampling/sampling_logp_difference/mean": 0.004481027275323868,
"step": 7670,
"step_time": 7.129984531603986
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1316.5,
"completions/max_terminated_length": 1138.5,
"completions/mean_length": 169.596875,
"completions/mean_terminated_length": 160.16558685302735,
"completions/min_length": 69.3,
"completions/min_terminated_length": 69.3,
"entropy": 0.05022773398086429,
"epoch": 16.445396145610278,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.36328125,
"learning_rate": 9.232100000000001e-06,
"loss": -0.0018,
"num_tokens": 791259590.0,
"reward": 1.0602539241313935,
"reward_std": 0.15934453681111335,
"rewards/reward_accuracy/mean": 0.960546875,
"rewards/reward_accuracy/std": 0.15829715132713318,
"rewards/reward_format/mean": 0.09970703274011612,
"rewards/reward_format/std": 0.0032527489587664605,
"sampling/importance_sampling_ratio/max": 2.4553956985473633,
"sampling/importance_sampling_ratio/mean": 0.9941927433013916,
"sampling/importance_sampling_ratio/min": 0.10739152580499649,
"sampling/sampling_logp_difference/max": 0.8538977980613709,
"sampling/sampling_logp_difference/mean": 0.004091818793676793,
"step": 7680,
"step_time": 6.425901420903392
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1519.9,
"completions/max_terminated_length": 1412.3,
"completions/mean_length": 166.165234375,
"completions/mean_terminated_length": 158.08096618652343,
"completions/min_length": 62.3,
"completions/min_terminated_length": 62.3,
"entropy": 0.04452686025761068,
"epoch": 16.466809421841543,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 9.2311e-06,
"loss": -0.0097,
"num_tokens": 792200765.0,
"reward": 1.0371679961681366,
"reward_std": 0.22112304344773293,
"rewards/reward_accuracy/mean": 0.9375,
"rewards/reward_accuracy/std": 0.21990354135632514,
"rewards/reward_format/mean": 0.09966796934604645,
"rewards/reward_format/std": 0.003605699702166021,
"sampling/importance_sampling_ratio/max": 2.496422255039215,
"sampling/importance_sampling_ratio/mean": 0.9955473244190216,
"sampling/importance_sampling_ratio/min": 0.10737686157226563,
"sampling/sampling_logp_difference/max": 0.8879212141036987,
"sampling/sampling_logp_difference/mean": 0.0037791854003444312,
"step": 7690,
"step_time": 7.404301803291309
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1437.1,
"completions/max_terminated_length": 1057.9,
"completions/mean_length": 155.59765625,
"completions/mean_terminated_length": 149.72595825195313,
"completions/min_length": 59.6,
"completions/min_terminated_length": 59.6,
"entropy": 0.04531383083667606,
"epoch": 16.488222698072803,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 9.2301e-06,
"loss": -0.0047,
"num_tokens": 793111367.0,
"reward": 1.0650195240974427,
"reward_std": 0.14569900035858155,
"rewards/reward_accuracy/mean": 0.965234375,
"rewards/reward_accuracy/std": 0.14457572847604752,
"rewards/reward_format/mean": 0.09978515580296517,
"rewards/reward_format/std": 0.0026407783618196843,
"sampling/importance_sampling_ratio/max": 2.327920925617218,
"sampling/importance_sampling_ratio/mean": 0.9955122828483581,
"sampling/importance_sampling_ratio/min": 0.1303410694003105,
"sampling/sampling_logp_difference/max": 1.03319993019104,
"sampling/sampling_logp_difference/mean": 0.003970151534304023,
"step": 7700,
"step_time": 6.816153975701309
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 9.5367431640625e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 9.5367431640625e-07,
"completions/clipped_ratio": 0.013671875,
"completions/max_length": 1535.2,
"completions/max_terminated_length": 1095.2,
"completions/mean_length": 179.491015625,
"completions/mean_terminated_length": 153.8226760864258,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.05156427307520062,
"epoch": 16.509635974304068,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.384765625,
"learning_rate": 9.229100000000001e-06,
"loss": -0.0041,
"num_tokens": 794090464.0,
"reward": 1.063281273841858,
"reward_std": 0.14494952335953712,
"rewards/reward_accuracy/mean": 0.964453125,
"rewards/reward_accuracy/std": 0.14091715216636658,
"rewards/reward_format/mean": 0.09882812574505806,
"rewards/reward_format/std": 0.006808904302306473,
"sampling/importance_sampling_ratio/max": 2.5002842783927917,
"sampling/importance_sampling_ratio/mean": 0.9845469772815705,
"sampling/importance_sampling_ratio/min": 0.1530655580572784,
"sampling/sampling_logp_difference/max": 0.9460946798324585,
"sampling/sampling_logp_difference/mean": 0.00435259654186666,
"step": 7710,
"step_time": 7.550421977887163
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1647.1,
"completions/max_terminated_length": 1461.3,
"completions/mean_length": 191.225,
"completions/mean_terminated_length": 172.44109954833985,
"completions/min_length": 69.2,
"completions/min_terminated_length": 69.2,
"entropy": 0.050309161515906455,
"epoch": 16.531049250535332,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 9.2281e-06,
"loss": -0.0033,
"num_tokens": 795098016.0,
"reward": 1.0714453101158141,
"reward_std": 0.14180126413702965,
"rewards/reward_accuracy/mean": 0.972265625,
"rewards/reward_accuracy/std": 0.1381421059370041,
"rewards/reward_format/mean": 0.0991796873509884,
"rewards/reward_format/std": 0.006191711546853185,
"sampling/importance_sampling_ratio/max": 2.449115180969238,
"sampling/importance_sampling_ratio/mean": 0.9880630433559418,
"sampling/importance_sampling_ratio/min": 0.07445607092231513,
"sampling/sampling_logp_difference/max": 0.8514467597007751,
"sampling/sampling_logp_difference/mean": 0.004171410016715527,
"step": 7720,
"step_time": 8.201009599788813
},
{
"clip_ratio/high_max": 1.1742602509912103e-05,
"clip_ratio/high_mean": 1.467825313739013e-06,
"clip_ratio/low_mean": 6.865114301035647e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.1543367438425774e-06,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1248.8,
"completions/max_terminated_length": 1087.3,
"completions/mean_length": 173.484765625,
"completions/mean_terminated_length": 156.65321502685546,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.04721232985612005,
"epoch": 16.552462526766597,
"frac_reward_zero_std": 0.84375,
"grad_norm": 0.474609375,
"learning_rate": 9.227100000000002e-06,
"loss": -0.0055,
"num_tokens": 796070233.0,
"reward": 1.0535937666893005,
"reward_std": 0.19303804337978364,
"rewards/reward_accuracy/mean": 0.954296875,
"rewards/reward_accuracy/std": 0.19049790725111962,
"rewards/reward_format/mean": 0.09929687604308128,
"rewards/reward_format/std": 0.004528086353093386,
"sampling/importance_sampling_ratio/max": 2.3360175609588625,
"sampling/importance_sampling_ratio/mean": 0.9925041139125824,
"sampling/importance_sampling_ratio/min": 0.11616698205471039,
"sampling/sampling_logp_difference/max": 1.0219195425510406,
"sampling/sampling_logp_difference/mean": 0.004211497073993087,
"step": 7730,
"step_time": 6.378574513708008
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1824.6,
"completions/max_terminated_length": 1574.6,
"completions/mean_length": 181.920703125,
"completions/mean_terminated_length": 165.1183853149414,
"completions/min_length": 65.7,
"completions/min_terminated_length": 65.7,
"entropy": 0.0513056218624115,
"epoch": 16.573875802997858,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.59765625,
"learning_rate": 9.226100000000001e-06,
"loss": -0.0071,
"num_tokens": 797054878.0,
"reward": 1.0558789134025575,
"reward_std": 0.18936727792024613,
"rewards/reward_accuracy/mean": 0.956640625,
"rewards/reward_accuracy/std": 0.18604489415884018,
"rewards/reward_format/mean": 0.09923828169703483,
"rewards/reward_format/std": 0.006994776544161141,
"sampling/importance_sampling_ratio/max": 2.5296329855918884,
"sampling/importance_sampling_ratio/mean": 0.9826992750167847,
"sampling/importance_sampling_ratio/min": 0.03513277173042297,
"sampling/sampling_logp_difference/max": 0.945905065536499,
"sampling/sampling_logp_difference/mean": 0.004355744412168861,
"step": 7740,
"step_time": 8.994800150583615
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1099.5,
"completions/max_terminated_length": 884.1,
"completions/mean_length": 151.4828125,
"completions/mean_terminated_length": 148.56255645751952,
"completions/min_length": 62.1,
"completions/min_terminated_length": 62.1,
"entropy": 0.03964817326050252,
"epoch": 16.595289079229122,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.5234375,
"learning_rate": 9.2251e-06,
"loss": 0.0017,
"num_tokens": 797955410.0,
"reward": 1.0768359661102296,
"reward_std": 0.11830514296889305,
"rewards/reward_accuracy/mean": 0.976953125,
"rewards/reward_accuracy/std": 0.11771604567766189,
"rewards/reward_format/mean": 0.09988281428813935,
"rewards/reward_format/std": 0.001323223067447543,
"sampling/importance_sampling_ratio/max": 2.3012039065361023,
"sampling/importance_sampling_ratio/mean": 0.996568912267685,
"sampling/importance_sampling_ratio/min": 0.2034597411751747,
"sampling/sampling_logp_difference/max": 1.00937317609787,
"sampling/sampling_logp_difference/mean": 0.0037071465281769632,
"step": 7750,
"step_time": 5.377568695822265
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1536.9,
"completions/max_terminated_length": 1450.1,
"completions/mean_length": 170.814453125,
"completions/mean_terminated_length": 164.22948303222657,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.051387568633072075,
"epoch": 16.616702355460387,
"frac_reward_zero_std": 0.84375,
"grad_norm": 0.2060546875,
"learning_rate": 9.2241e-06,
"loss": -0.0091,
"num_tokens": 798901735.0,
"reward": 1.0661328315734864,
"reward_std": 0.14783263802528382,
"rewards/reward_accuracy/mean": 0.96640625,
"rewards/reward_accuracy/std": 0.1465184636414051,
"rewards/reward_format/mean": 0.09972656294703483,
"rewards/reward_format/std": 0.00299612102098763,
"sampling/importance_sampling_ratio/max": 2.563726031780243,
"sampling/importance_sampling_ratio/mean": 0.9753252685070037,
"sampling/importance_sampling_ratio/min": 0.12071237601339817,
"sampling/sampling_logp_difference/max": 0.8235949575901031,
"sampling/sampling_logp_difference/mean": 0.004235922615043819,
"step": 7760,
"step_time": 7.485675041918876
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.016796875,
"completions/max_length": 1656.3,
"completions/max_terminated_length": 1493.5,
"completions/mean_length": 209.28515625,
"completions/mean_terminated_length": 180.4291030883789,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.056952106021344664,
"epoch": 16.638115631691647,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.52734375,
"learning_rate": 9.2231e-06,
"loss": -0.0089,
"num_tokens": 799960129.0,
"reward": 1.0343554854393004,
"reward_std": 0.19792354255914688,
"rewards/reward_accuracy/mean": 0.9359375,
"rewards/reward_accuracy/std": 0.19391807690262794,
"rewards/reward_format/mean": 0.09841796979308129,
"rewards/reward_format/std": 0.00651839436031878,
"sampling/importance_sampling_ratio/max": 2.535571241378784,
"sampling/importance_sampling_ratio/mean": 0.9709712982177734,
"sampling/importance_sampling_ratio/min": 0.05337768867611885,
"sampling/sampling_logp_difference/max": 1.1966431975364684,
"sampling/sampling_logp_difference/mean": 0.004524283809587359,
"step": 7770,
"step_time": 8.126159263201407
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1453.1,
"completions/max_terminated_length": 1126.4,
"completions/mean_length": 175.510546875,
"completions/mean_terminated_length": 159.41243438720704,
"completions/min_length": 67.6,
"completions/min_terminated_length": 67.6,
"entropy": 0.04718698477372527,
"epoch": 16.659528907922912,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.404296875,
"learning_rate": 9.222100000000001e-06,
"loss": -0.002,
"num_tokens": 800930604.0,
"reward": 1.071582055091858,
"reward_std": 0.1455278627574444,
"rewards/reward_accuracy/mean": 0.972265625,
"rewards/reward_accuracy/std": 0.14231296256184578,
"rewards/reward_format/mean": 0.09931640699505806,
"rewards/reward_format/std": 0.004727099556475878,
"sampling/importance_sampling_ratio/max": 2.5430553555488586,
"sampling/importance_sampling_ratio/mean": 0.9843396961688995,
"sampling/importance_sampling_ratio/min": 0.122025528550148,
"sampling/sampling_logp_difference/max": 0.8583072304725647,
"sampling/sampling_logp_difference/mean": 0.004209183575585485,
"step": 7780,
"step_time": 7.1859231060079765
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1328.2,
"completions/max_terminated_length": 1103.0,
"completions/mean_length": 156.35703125,
"completions/mean_terminated_length": 149.10735168457032,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.042606739862822,
"epoch": 16.680942184154176,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.265625,
"learning_rate": 9.2211e-06,
"loss": -0.0021,
"num_tokens": 801849406.0,
"reward": 1.0766601800918578,
"reward_std": 0.12851392328739167,
"rewards/reward_accuracy/mean": 0.976953125,
"rewards/reward_accuracy/std": 0.12701146379113198,
"rewards/reward_format/mean": 0.09970703274011612,
"rewards/reward_format/std": 0.002431714185513556,
"sampling/importance_sampling_ratio/max": 2.47778434753418,
"sampling/importance_sampling_ratio/mean": 0.997530484199524,
"sampling/importance_sampling_ratio/min": 0.13741500955075026,
"sampling/sampling_logp_difference/max": 1.057798719406128,
"sampling/sampling_logp_difference/mean": 0.004012746992520988,
"step": 7790,
"step_time": 6.560001490192372
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1405.1,
"completions/max_terminated_length": 1231.3,
"completions/mean_length": 159.006640625,
"completions/mean_terminated_length": 150.84038391113282,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.046332542807795106,
"epoch": 16.70235546038544,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.90234375,
"learning_rate": 9.2201e-06,
"loss": 0.0016,
"num_tokens": 802772575.0,
"reward": 1.062460970878601,
"reward_std": 0.16013382407836615,
"rewards/reward_accuracy/mean": 0.962890625,
"rewards/reward_accuracy/std": 0.15820884853601455,
"rewards/reward_format/mean": 0.09957031533122063,
"rewards/reward_format/std": 0.003950121020898223,
"sampling/importance_sampling_ratio/max": 2.2630041003227235,
"sampling/importance_sampling_ratio/mean": 0.9781794428825379,
"sampling/importance_sampling_ratio/min": 0.11480211019515991,
"sampling/sampling_logp_difference/max": 0.9216413736343384,
"sampling/sampling_logp_difference/mean": 0.00394847805146128,
"step": 7800,
"step_time": 6.911890725800186
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1025.4,
"completions/max_terminated_length": 996.9,
"completions/mean_length": 150.25390625,
"completions/mean_terminated_length": 146.58380737304688,
"completions/min_length": 60.1,
"completions/min_terminated_length": 60.1,
"entropy": 0.0456536918412894,
"epoch": 16.7237687366167,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.396484375,
"learning_rate": 9.219100000000001e-06,
"loss": -0.0018,
"num_tokens": 803669433.0,
"reward": 1.0674023747444152,
"reward_std": 0.15069975778460504,
"rewards/reward_accuracy/mean": 0.967578125,
"rewards/reward_accuracy/std": 0.14958580061793328,
"rewards/reward_format/mean": 0.09982422068715095,
"rewards/reward_format/std": 0.0017759525682777167,
"sampling/importance_sampling_ratio/max": 2.512754464149475,
"sampling/importance_sampling_ratio/mean": 0.998466145992279,
"sampling/importance_sampling_ratio/min": 0.12625685408711435,
"sampling/sampling_logp_difference/max": 0.8312036693096161,
"sampling/sampling_logp_difference/mean": 0.004134365939535201,
"step": 7810,
"step_time": 4.971902744504041
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1403.2,
"completions/max_terminated_length": 968.3,
"completions/mean_length": 158.720703125,
"completions/mean_terminated_length": 153.60763092041014,
"completions/min_length": 69.2,
"completions/min_terminated_length": 69.2,
"entropy": 0.04434063301887363,
"epoch": 16.745182012847966,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.0,
"learning_rate": 9.2181e-06,
"loss": -0.0027,
"num_tokens": 804604494.0,
"reward": 1.0661328196525575,
"reward_std": 0.15368699431419372,
"rewards/reward_accuracy/mean": 0.96640625,
"rewards/reward_accuracy/std": 0.1519726999104023,
"rewards/reward_format/mean": 0.09972656294703483,
"rewards/reward_format/std": 0.003483161237090826,
"sampling/importance_sampling_ratio/max": 2.4614560127258303,
"sampling/importance_sampling_ratio/mean": 0.9900545418262482,
"sampling/importance_sampling_ratio/min": 0.1255536837503314,
"sampling/sampling_logp_difference/max": 1.4378287553787232,
"sampling/sampling_logp_difference/mean": 0.004353168071247637,
"step": 7820,
"step_time": 6.579145183684886
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1606.5,
"completions/max_terminated_length": 1428.8,
"completions/mean_length": 172.39921875,
"completions/mean_terminated_length": 161.42025909423828,
"completions/min_length": 67.7,
"completions/min_terminated_length": 67.7,
"entropy": 0.050095995678566395,
"epoch": 16.76659528907923,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0,
"learning_rate": 9.2171e-06,
"loss": -0.0059,
"num_tokens": 805565548.0,
"reward": 1.0632031321525575,
"reward_std": 0.1591066375374794,
"rewards/reward_accuracy/mean": 0.963671875,
"rewards/reward_accuracy/std": 0.15679568126797677,
"rewards/reward_format/mean": 0.0995312511920929,
"rewards/reward_format/std": 0.004287804500199855,
"sampling/importance_sampling_ratio/max": 2.5324663639068605,
"sampling/importance_sampling_ratio/mean": 0.982275378704071,
"sampling/importance_sampling_ratio/min": 0.09124839901924134,
"sampling/sampling_logp_difference/max": 0.9770475625991821,
"sampling/sampling_logp_difference/mean": 0.004294572421349585,
"step": 7830,
"step_time": 7.903159433606197
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1894.9,
"completions/max_terminated_length": 1611.0,
"completions/mean_length": 187.95703125,
"completions/mean_terminated_length": 177.0829605102539,
"completions/min_length": 70.0,
"completions/min_terminated_length": 70.0,
"entropy": 0.05079558119177818,
"epoch": 16.78800856531049,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.5,
"learning_rate": 9.216100000000001e-06,
"loss": -0.0091,
"num_tokens": 806572606.0,
"reward": 1.0513867557048797,
"reward_std": 0.20299932807683946,
"rewards/reward_accuracy/mean": 0.951953125,
"rewards/reward_accuracy/std": 0.20061067268252372,
"rewards/reward_format/mean": 0.09943359643220902,
"rewards/reward_format/std": 0.005329398345202208,
"sampling/importance_sampling_ratio/max": 2.6396435499191284,
"sampling/importance_sampling_ratio/mean": 0.9926622807979584,
"sampling/importance_sampling_ratio/min": 0.11464942563325167,
"sampling/sampling_logp_difference/max": 0.990067183971405,
"sampling/sampling_logp_difference/mean": 0.00419128944631666,
"step": 7840,
"step_time": 8.954967654502251
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.060693330146023e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.060693330146023e-06,
"completions/clipped_ratio": 0.019921875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1643.3,
"completions/mean_length": 211.148046875,
"completions/mean_terminated_length": 173.8470657348633,
"completions/min_length": 68.5,
"completions/min_terminated_length": 68.5,
"entropy": 0.0661642503226176,
"epoch": 16.809421841541756,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.06689453125,
"learning_rate": 9.215100000000001e-06,
"loss": -0.0088,
"num_tokens": 807634265.0,
"reward": 1.0313476920127869,
"reward_std": 0.2388788156211376,
"rewards/reward_accuracy/mean": 0.9328125,
"rewards/reward_accuracy/std": 0.23295548632740976,
"rewards/reward_format/mean": 0.0985351599752903,
"rewards/reward_format/std": 0.010887856548652052,
"sampling/importance_sampling_ratio/max": 2.439284348487854,
"sampling/importance_sampling_ratio/mean": 0.9685746312141419,
"sampling/importance_sampling_ratio/min": 0.010910131270065904,
"sampling/sampling_logp_difference/max": 1.0593733429908752,
"sampling/sampling_logp_difference/mean": 0.004693446471355856,
"step": 7850,
"step_time": 10.37301104129583
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1298.7,
"completions/max_terminated_length": 1231.1,
"completions/mean_length": 168.576171875,
"completions/mean_terminated_length": 155.38970947265625,
"completions/min_length": 67.9,
"completions/min_terminated_length": 67.9,
"entropy": 0.0520853090332821,
"epoch": 16.83083511777302,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 9.2141e-06,
"loss": -0.0059,
"num_tokens": 808579276.0,
"reward": 1.0369336247444152,
"reward_std": 0.21079855188727378,
"rewards/reward_accuracy/mean": 0.9375,
"rewards/reward_accuracy/std": 0.208419618755579,
"rewards/reward_format/mean": 0.09943359568715096,
"rewards/reward_format/std": 0.004434091318398714,
"sampling/importance_sampling_ratio/max": 2.4801127433776857,
"sampling/importance_sampling_ratio/mean": 0.9865872621536255,
"sampling/importance_sampling_ratio/min": 0.1934816412627697,
"sampling/sampling_logp_difference/max": 0.920253586769104,
"sampling/sampling_logp_difference/mean": 0.004261549282819033,
"step": 7860,
"step_time": 6.434256394812837
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.670781123015331e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.670781123015331e-06,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1546.7,
"completions/max_terminated_length": 1279.3,
"completions/mean_length": 184.190625,
"completions/mean_terminated_length": 167.60396881103514,
"completions/min_length": 63.7,
"completions/min_terminated_length": 63.7,
"entropy": 0.054577568615786734,
"epoch": 16.85224839400428,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.197265625,
"learning_rate": 9.2131e-06,
"loss": -0.0069,
"num_tokens": 809563332.0,
"reward": 1.0346875071525574,
"reward_std": 0.21321952044963838,
"rewards/reward_accuracy/mean": 0.935546875,
"rewards/reward_accuracy/std": 0.21048423573374747,
"rewards/reward_format/mean": 0.09914062544703484,
"rewards/reward_format/std": 0.005468779825605452,
"sampling/importance_sampling_ratio/max": 2.4845311403274537,
"sampling/importance_sampling_ratio/mean": 0.9815246641635895,
"sampling/importance_sampling_ratio/min": 0.0818779714871198,
"sampling/sampling_logp_difference/max": 0.9205900669097901,
"sampling/sampling_logp_difference/mean": 0.004278291272930801,
"step": 7870,
"step_time": 7.7146914764132815
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1694.3,
"completions/max_terminated_length": 1119.8,
"completions/mean_length": 160.0203125,
"completions/mean_terminated_length": 151.16456909179686,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.04444997753016651,
"epoch": 16.873661670235546,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.3046875,
"learning_rate": 9.212100000000001e-06,
"loss": -0.0014,
"num_tokens": 810493800.0,
"reward": 1.0691601634025574,
"reward_std": 0.1456493191421032,
"rewards/reward_accuracy/mean": 0.96953125,
"rewards/reward_accuracy/std": 0.1436914436519146,
"rewards/reward_format/mean": 0.09962890669703484,
"rewards/reward_format/std": 0.004088753298856318,
"sampling/importance_sampling_ratio/max": 2.4229501128196715,
"sampling/importance_sampling_ratio/mean": 0.9884009003639221,
"sampling/importance_sampling_ratio/min": 0.11865779757499695,
"sampling/sampling_logp_difference/max": 0.9414014637470245,
"sampling/sampling_logp_difference/mean": 0.004059745161794126,
"step": 7880,
"step_time": 7.8519132131012155
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1272.1,
"completions/max_terminated_length": 1050.7,
"completions/mean_length": 164.132421875,
"completions/mean_terminated_length": 158.4006362915039,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.052544075553305446,
"epoch": 16.89507494646681,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.0,
"learning_rate": 9.2111e-06,
"loss": -0.0097,
"num_tokens": 811431051.0,
"reward": 1.0637109518051147,
"reward_std": 0.15563071221113206,
"rewards/reward_accuracy/mean": 0.9640625,
"rewards/reward_accuracy/std": 0.15434372648596764,
"rewards/reward_format/mean": 0.09964843913912773,
"rewards/reward_format/std": 0.0033515871502459047,
"sampling/importance_sampling_ratio/max": 2.5649507522583006,
"sampling/importance_sampling_ratio/mean": 0.9779794991016388,
"sampling/importance_sampling_ratio/min": 0.15262180827558042,
"sampling/sampling_logp_difference/max": 1.103963178396225,
"sampling/sampling_logp_difference/mean": 0.0045566009124740955,
"step": 7890,
"step_time": 6.163933215700672
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1509.5,
"completions/max_terminated_length": 1248.2,
"completions/mean_length": 164.26484375,
"completions/mean_terminated_length": 156.22708587646486,
"completions/min_length": 63.2,
"completions/min_terminated_length": 63.2,
"entropy": 0.05159259357023984,
"epoch": 16.916488222698074,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.50390625,
"learning_rate": 9.2101e-06,
"loss": -0.0008,
"num_tokens": 812373585.0,
"reward": 1.0507226705551147,
"reward_std": 0.207310052216053,
"rewards/reward_accuracy/mean": 0.951171875,
"rewards/reward_accuracy/std": 0.20540243983268738,
"rewards/reward_format/mean": 0.09955078214406968,
"rewards/reward_format/std": 0.004364579729735851,
"sampling/importance_sampling_ratio/max": 2.67408447265625,
"sampling/importance_sampling_ratio/mean": 0.9874327719211579,
"sampling/importance_sampling_ratio/min": 0.07246538326144218,
"sampling/sampling_logp_difference/max": 1.087788814306259,
"sampling/sampling_logp_difference/mean": 0.004623599885962904,
"step": 7900,
"step_time": 7.237487175303977
},
{
"clip_ratio/high_max": 1.4321722846943886e-05,
"clip_ratio/high_mean": 1.7902153558679857e-06,
"clip_ratio/low_mean": 5.201325029702275e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 6.991540476519731e-06,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1481.6,
"completions/max_terminated_length": 1007.5,
"completions/mean_length": 157.823828125,
"completions/mean_terminated_length": 145.2296340942383,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.04617567043751478,
"epoch": 16.937901498929335,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.0,
"learning_rate": 9.209100000000001e-06,
"loss": -0.0093,
"num_tokens": 813293022.0,
"reward": 1.050488293170929,
"reward_std": 0.1860833279788494,
"rewards/reward_accuracy/mean": 0.951171875,
"rewards/reward_accuracy/std": 0.1832117460668087,
"rewards/reward_format/mean": 0.09931640699505806,
"rewards/reward_format/std": 0.005324616725556552,
"sampling/importance_sampling_ratio/max": 2.542310643196106,
"sampling/importance_sampling_ratio/mean": 0.9819382846355438,
"sampling/importance_sampling_ratio/min": 0.15245852544903754,
"sampling/sampling_logp_difference/max": 0.8428882718086242,
"sampling/sampling_logp_difference/mean": 0.004435072559863329,
"step": 7910,
"step_time": 7.167223082206329
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1559.2,
"completions/max_terminated_length": 1273.7,
"completions/mean_length": 155.5296875,
"completions/mean_terminated_length": 147.4967025756836,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.044794931169599296,
"epoch": 16.9593147751606,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.46484375,
"learning_rate": 9.2081e-06,
"loss": -0.0088,
"num_tokens": 814204074.0,
"reward": 1.0657812714576722,
"reward_std": 0.15105870068073274,
"rewards/reward_accuracy/mean": 0.966015625,
"rewards/reward_accuracy/std": 0.1500009149312973,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.002492625452578068,
"sampling/importance_sampling_ratio/max": 2.4844964861869814,
"sampling/importance_sampling_ratio/mean": 0.9900657832622528,
"sampling/importance_sampling_ratio/min": 0.10017420575022698,
"sampling/sampling_logp_difference/max": 0.9110117316246032,
"sampling/sampling_logp_difference/mean": 0.004133661114610732,
"step": 7920,
"step_time": 7.317238017416093
},
{
"clip_ratio/high_max": 6.980444013606756e-05,
"clip_ratio/high_mean": 8.725555017008445e-06,
"clip_ratio/low_mean": 7.477683539036661e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 9.473323370912112e-06,
"completions/clipped_ratio": 0.01328125,
"completions/max_length": 1472.7,
"completions/max_terminated_length": 1213.5,
"completions/mean_length": 175.2140625,
"completions/mean_terminated_length": 150.09844055175782,
"completions/min_length": 63.5,
"completions/min_terminated_length": 63.5,
"entropy": 0.04913273158017546,
"epoch": 16.980728051391864,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.028564453125,
"learning_rate": 9.2071e-06,
"loss": 0.0029,
"num_tokens": 815170270.0,
"reward": 1.0486914038658142,
"reward_std": 0.19494396820664406,
"rewards/reward_accuracy/mean": 0.949609375,
"rewards/reward_accuracy/std": 0.1916939251124859,
"rewards/reward_format/mean": 0.09908203184604644,
"rewards/reward_format/std": 0.005961838387884199,
"sampling/importance_sampling_ratio/max": 2.5625113964080812,
"sampling/importance_sampling_ratio/mean": 0.9907922148704529,
"sampling/importance_sampling_ratio/min": 0.15967635922133921,
"sampling/sampling_logp_difference/max": 0.9309791684150696,
"sampling/sampling_logp_difference/mean": 0.004130323929712176,
"step": 7930,
"step_time": 7.560866497407551
},
{
"clip_ratio/high_max": 0.0001038600574247539,
"clip_ratio/high_mean": 1.2982507178094238e-05,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.2982507178094238e-05,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1580.3,
"completions/max_terminated_length": 1272.1,
"completions/mean_length": 150.480859375,
"completions/mean_terminated_length": 143.80609512329102,
"completions/min_length": 67.2,
"completions/min_terminated_length": 67.2,
"entropy": 0.04085923647508025,
"epoch": 17.002141327623125,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.423828125,
"learning_rate": 9.206100000000002e-06,
"loss": -0.0079,
"num_tokens": 816072445.0,
"reward": 1.053671908378601,
"reward_std": 0.1871044233441353,
"rewards/reward_accuracy/mean": 0.95390625,
"rewards/reward_accuracy/std": 0.18586539700627328,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0024736269377171995,
"sampling/importance_sampling_ratio/max": 2.5696367025375366,
"sampling/importance_sampling_ratio/mean": 0.9886203289031983,
"sampling/importance_sampling_ratio/min": 0.08471763841807842,
"sampling/sampling_logp_difference/max": 0.9872049689292908,
"sampling/sampling_logp_difference/mean": 0.003960961941629648,
"step": 7940,
"step_time": 7.367305375190336
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1731.7,
"completions/max_terminated_length": 1384.3,
"completions/mean_length": 166.268359375,
"completions/mean_terminated_length": 155.9521484375,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.046828650124371055,
"epoch": 17.02355460385439,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.46875,
"learning_rate": 9.205100000000001e-06,
"loss": -0.0111,
"num_tokens": 817024604.0,
"reward": 1.0562304735183716,
"reward_std": 0.18308002278208732,
"rewards/reward_accuracy/mean": 0.956640625,
"rewards/reward_accuracy/std": 0.18140590488910674,
"rewards/reward_format/mean": 0.09958984404802322,
"rewards/reward_format/std": 0.004021363588981331,
"sampling/importance_sampling_ratio/max": 2.3097330212593077,
"sampling/importance_sampling_ratio/mean": 0.984870332479477,
"sampling/importance_sampling_ratio/min": 0.10082997754216194,
"sampling/sampling_logp_difference/max": 1.1282589197158814,
"sampling/sampling_logp_difference/mean": 0.004153356025926769,
"step": 7950,
"step_time": 8.074162628484192
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1618.6,
"completions/max_terminated_length": 1554.1,
"completions/mean_length": 189.009375,
"completions/mean_terminated_length": 168.7215606689453,
"completions/min_length": 72.8,
"completions/min_terminated_length": 72.8,
"entropy": 0.05142954755574465,
"epoch": 17.044967880085654,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.267578125,
"learning_rate": 9.2041e-06,
"loss": 0.0004,
"num_tokens": 818028884.0,
"reward": 1.0421875357627868,
"reward_std": 0.20422518849372864,
"rewards/reward_accuracy/mean": 0.94296875,
"rewards/reward_accuracy/std": 0.2015540987253189,
"rewards/reward_format/mean": 0.09921875223517418,
"rewards/reward_format/std": 0.005188230704516172,
"sampling/importance_sampling_ratio/max": 2.5283949613571166,
"sampling/importance_sampling_ratio/mean": 0.9811752736568451,
"sampling/importance_sampling_ratio/min": 0.08870219103991986,
"sampling/sampling_logp_difference/max": 1.080541741847992,
"sampling/sampling_logp_difference/mean": 0.00421747756190598,
"step": 7960,
"step_time": 8.140294003803865
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1312.0,
"completions/max_terminated_length": 885.9,
"completions/mean_length": 149.602734375,
"completions/mean_terminated_length": 145.8874366760254,
"completions/min_length": 63.7,
"completions/min_terminated_length": 63.7,
"entropy": 0.04356088605709374,
"epoch": 17.066381156316915,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.875,
"learning_rate": 9.2031e-06,
"loss": -0.0035,
"num_tokens": 818926395.0,
"reward": 1.0639062762260436,
"reward_std": 0.1527715802192688,
"rewards/reward_accuracy/mean": 0.9640625,
"rewards/reward_accuracy/std": 0.15149355307221413,
"rewards/reward_format/mean": 0.09984375163912773,
"rewards/reward_format/std": 0.0021321487613022326,
"sampling/importance_sampling_ratio/max": 2.35757462978363,
"sampling/importance_sampling_ratio/mean": 0.9836565732955933,
"sampling/importance_sampling_ratio/min": 0.15019432380795478,
"sampling/sampling_logp_difference/max": 0.774815022945404,
"sampling/sampling_logp_difference/mean": 0.004023663070984185,
"step": 7970,
"step_time": 6.279906190003385
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1709.4,
"completions/max_terminated_length": 1513.2,
"completions/mean_length": 173.560546875,
"completions/mean_terminated_length": 158.8384216308594,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.05431927829049528,
"epoch": 17.08779443254818,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.251953125,
"learning_rate": 9.202100000000001e-06,
"loss": -0.009,
"num_tokens": 819898086.0,
"reward": 1.0622070550918579,
"reward_std": 0.17893914729356766,
"rewards/reward_accuracy/mean": 0.962890625,
"rewards/reward_accuracy/std": 0.17551999017596245,
"rewards/reward_format/mean": 0.09931640774011612,
"rewards/reward_format/std": 0.005934580159373581,
"sampling/importance_sampling_ratio/max": 2.374729299545288,
"sampling/importance_sampling_ratio/mean": 0.9698988676071167,
"sampling/importance_sampling_ratio/min": 0.08764871843159198,
"sampling/sampling_logp_difference/max": 0.934401524066925,
"sampling/sampling_logp_difference/mean": 0.0044356407830491665,
"step": 7980,
"step_time": 8.086257524800022
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1213.7,
"completions/max_terminated_length": 987.5,
"completions/mean_length": 156.43203125,
"completions/mean_terminated_length": 150.5750762939453,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.04311148843262345,
"epoch": 17.109207708779444,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 9.2011e-06,
"loss": -0.0067,
"num_tokens": 820817208.0,
"reward": 1.0868359565734864,
"reward_std": 0.07326010316610336,
"rewards/reward_accuracy/mean": 0.987109375,
"rewards/reward_accuracy/std": 0.07122102156281471,
"rewards/reward_format/mean": 0.0997265636920929,
"rewards/reward_format/std": 0.0031184528023004534,
"sampling/importance_sampling_ratio/max": 2.3598856806755064,
"sampling/importance_sampling_ratio/mean": 0.9913330137729645,
"sampling/importance_sampling_ratio/min": 0.15553861558437349,
"sampling/sampling_logp_difference/max": 0.9304038405418396,
"sampling/sampling_logp_difference/mean": 0.003903127904050052,
"step": 7990,
"step_time": 5.909126733604353
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1521.6,
"completions/max_terminated_length": 1144.3,
"completions/mean_length": 158.815625,
"completions/mean_terminated_length": 150.73645629882813,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.044104913552291694,
"epoch": 17.130620985010708,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.640625,
"learning_rate": 9.2001e-06,
"loss": -0.008,
"num_tokens": 821737840.0,
"reward": 1.054785168170929,
"reward_std": 0.17136799171566963,
"rewards/reward_accuracy/mean": 0.955078125,
"rewards/reward_accuracy/std": 0.1695178508758545,
"rewards/reward_format/mean": 0.09970703199505807,
"rewards/reward_format/std": 0.0034111268585547807,
"sampling/importance_sampling_ratio/max": 2.3898055076599123,
"sampling/importance_sampling_ratio/mean": 0.9928334772586822,
"sampling/importance_sampling_ratio/min": 0.1106077965348959,
"sampling/sampling_logp_difference/max": 0.8412916123867035,
"sampling/sampling_logp_difference/mean": 0.004080133489333093,
"step": 8000,
"step_time": 7.222813133327873
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1525.3,
"completions/max_terminated_length": 1170.0,
"completions/mean_length": 167.216796875,
"completions/mean_terminated_length": 155.45998764038086,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.04964595704805106,
"epoch": 17.15203426124197,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.0,
"learning_rate": 9.199100000000001e-06,
"loss": -0.0088,
"num_tokens": 822684683.0,
"reward": 1.0537500023841857,
"reward_std": 0.19027013778686525,
"rewards/reward_accuracy/mean": 0.954296875,
"rewards/reward_accuracy/std": 0.1875868022441864,
"rewards/reward_format/mean": 0.09945312589406967,
"rewards/reward_format/std": 0.004815586167387665,
"sampling/importance_sampling_ratio/max": 2.465027356147766,
"sampling/importance_sampling_ratio/mean": 0.9932780802249909,
"sampling/importance_sampling_ratio/min": 0.0766778826713562,
"sampling/sampling_logp_difference/max": 0.8728473544120788,
"sampling/sampling_logp_difference/mean": 0.004328899155370891,
"step": 8010,
"step_time": 7.266196236776887
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1377.8,
"completions/max_terminated_length": 1135.1,
"completions/mean_length": 153.5546875,
"completions/mean_terminated_length": 150.6128890991211,
"completions/min_length": 68.1,
"completions/min_terminated_length": 68.1,
"entropy": 0.04408352908212691,
"epoch": 17.173447537473233,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.38671875,
"learning_rate": 9.198100000000001e-06,
"loss": 0.0002,
"num_tokens": 823598279.0,
"reward": 1.0722070455551147,
"reward_std": 0.14976460859179497,
"rewards/reward_accuracy/mean": 0.972265625,
"rewards/reward_accuracy/std": 0.14912991896271705,
"rewards/reward_format/mean": 0.09994140714406967,
"rewards/reward_format/std": 0.0009375000605359674,
"sampling/importance_sampling_ratio/max": 2.5915315628051756,
"sampling/importance_sampling_ratio/mean": 0.9916715264320374,
"sampling/importance_sampling_ratio/min": 0.10200010389089584,
"sampling/sampling_logp_difference/max": 0.774946790933609,
"sampling/sampling_logp_difference/mean": 0.00414877466391772,
"step": 8020,
"step_time": 6.398435724916635
},
{
"clip_ratio/high_max": 1.4514630311168731e-05,
"clip_ratio/high_mean": 1.8143287888960914e-06,
"clip_ratio/low_mean": 4.222608004056383e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 6.036936792952474e-06,
"completions/clipped_ratio": 0.013671875,
"completions/max_length": 1604.1,
"completions/max_terminated_length": 1132.6,
"completions/mean_length": 180.948828125,
"completions/mean_terminated_length": 155.14728546142578,
"completions/min_length": 67.6,
"completions/min_terminated_length": 67.6,
"entropy": 0.050092419935390355,
"epoch": 17.194860813704498,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.1962890625,
"learning_rate": 9.1971e-06,
"loss": -0.0025,
"num_tokens": 824573140.0,
"reward": 1.0660547137260437,
"reward_std": 0.15692453682422638,
"rewards/reward_accuracy/mean": 0.9671875,
"rewards/reward_accuracy/std": 0.15192557871341705,
"rewards/reward_format/mean": 0.09886718913912773,
"rewards/reward_format/std": 0.007547743059694767,
"sampling/importance_sampling_ratio/max": 2.5463247299194336,
"sampling/importance_sampling_ratio/mean": 0.9881521940231324,
"sampling/importance_sampling_ratio/min": 0.09340537302196025,
"sampling/sampling_logp_difference/max": 1.4276350498199464,
"sampling/sampling_logp_difference/mean": 0.004309175512753427,
"step": 8030,
"step_time": 8.047182117105695
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1662.9,
"completions/max_terminated_length": 1482.0,
"completions/mean_length": 168.873828125,
"completions/mean_terminated_length": 159.34021911621093,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.04604514669626951,
"epoch": 17.21627408993576,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.875,
"learning_rate": 9.196100000000002e-06,
"loss": -0.0061,
"num_tokens": 825520481.0,
"reward": 1.0331640779972076,
"reward_std": 0.2270587593317032,
"rewards/reward_accuracy/mean": 0.93359375,
"rewards/reward_accuracy/std": 0.22586587816476822,
"rewards/reward_format/mean": 0.09957031384110451,
"rewards/reward_format/std": 0.00435292455367744,
"sampling/importance_sampling_ratio/max": 2.4621651649475096,
"sampling/importance_sampling_ratio/mean": 0.9847799837589264,
"sampling/importance_sampling_ratio/min": 0.0707425655797124,
"sampling/sampling_logp_difference/max": 0.9635183990001679,
"sampling/sampling_logp_difference/mean": 0.004119280469603836,
"step": 8040,
"step_time": 7.837344812692026
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1109.0,
"completions/max_terminated_length": 802.7,
"completions/mean_length": 138.488671875,
"completions/mean_terminated_length": 133.35906982421875,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.04009682624600828,
"epoch": 17.237687366167023,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.0,
"learning_rate": 9.195100000000001e-06,
"loss": -0.0008,
"num_tokens": 826381668.0,
"reward": 1.0826171934604645,
"reward_std": 0.07561039552092552,
"rewards/reward_accuracy/mean": 0.9828125,
"rewards/reward_accuracy/std": 0.0744997963309288,
"rewards/reward_format/mean": 0.0998046875,
"rewards/reward_format/std": 0.0023282783571630717,
"sampling/importance_sampling_ratio/max": 2.4957231163978575,
"sampling/importance_sampling_ratio/mean": 0.9950333416461945,
"sampling/importance_sampling_ratio/min": 0.12558613903820515,
"sampling/sampling_logp_difference/max": 0.9294018745422363,
"sampling/sampling_logp_difference/mean": 0.0037480346392840145,
"step": 8050,
"step_time": 5.466290654306067
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1201.0,
"completions/max_terminated_length": 978.6,
"completions/mean_length": 148.087109375,
"completions/mean_terminated_length": 142.89873809814452,
"completions/min_length": 70.7,
"completions/min_terminated_length": 70.7,
"entropy": 0.03861781565938145,
"epoch": 17.259100642398288,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 9.1941e-06,
"loss": -0.0031,
"num_tokens": 827274291.0,
"reward": 1.0849804878234863,
"reward_std": 0.07657976299524308,
"rewards/reward_accuracy/mean": 0.98515625,
"rewards/reward_accuracy/std": 0.07531862705945969,
"rewards/reward_format/mean": 0.0998242199420929,
"rewards/reward_format/std": 0.0025726744905114176,
"sampling/importance_sampling_ratio/max": 2.2983739495277407,
"sampling/importance_sampling_ratio/mean": 1.0012471735477448,
"sampling/importance_sampling_ratio/min": 0.19418838173151015,
"sampling/sampling_logp_difference/max": 0.918752646446228,
"sampling/sampling_logp_difference/mean": 0.0037654986139386893,
"step": 8060,
"step_time": 5.768169420785853
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1120.9,
"completions/max_terminated_length": 1073.9,
"completions/mean_length": 145.09375,
"completions/mean_terminated_length": 140.712646484375,
"completions/min_length": 62.0,
"completions/min_terminated_length": 62.0,
"entropy": 0.04081552072893828,
"epoch": 17.280513918629552,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.2412109375,
"learning_rate": 9.1931e-06,
"loss": -0.0055,
"num_tokens": 828159235.0,
"reward": 1.0810351848602295,
"reward_std": 0.10267976447939872,
"rewards/reward_accuracy/mean": 0.98125,
"rewards/reward_accuracy/std": 0.10175533667206764,
"rewards/reward_format/mean": 0.09978515729308128,
"rewards/reward_format/std": 0.0022729270393028857,
"sampling/importance_sampling_ratio/max": 2.3744969010353087,
"sampling/importance_sampling_ratio/mean": 0.9927258193492889,
"sampling/importance_sampling_ratio/min": 0.050418103300035,
"sampling/sampling_logp_difference/max": 1.0043106555938721,
"sampling/sampling_logp_difference/mean": 0.003969394695013761,
"step": 8070,
"step_time": 5.43159151490836
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.0067595616856125e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.0067595616856125e-06,
"completions/clipped_ratio": 0.01328125,
"completions/max_length": 1460.0,
"completions/max_terminated_length": 1228.5,
"completions/mean_length": 188.065625,
"completions/mean_terminated_length": 163.1705307006836,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.053507500281557444,
"epoch": 17.301927194860813,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.37890625,
"learning_rate": 9.1921e-06,
"loss": -0.0025,
"num_tokens": 829165531.0,
"reward": 1.038398450613022,
"reward_std": 0.19378407448530197,
"rewards/reward_accuracy/mean": 0.939453125,
"rewards/reward_accuracy/std": 0.19033357501029968,
"rewards/reward_format/mean": 0.09894531369209289,
"rewards/reward_format/std": 0.006215920322574675,
"sampling/importance_sampling_ratio/max": 2.6088112592697144,
"sampling/importance_sampling_ratio/mean": 0.9813559710979461,
"sampling/importance_sampling_ratio/min": 0.09953399449586868,
"sampling/sampling_logp_difference/max": 0.9627541899681091,
"sampling/sampling_logp_difference/mean": 0.0041549039306119084,
"step": 8080,
"step_time": 7.461515807692194
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1302.7,
"completions/max_terminated_length": 1249.9,
"completions/mean_length": 159.618359375,
"completions/mean_terminated_length": 152.36002349853516,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.0471513032913208,
"epoch": 17.323340471092077,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 9.1911e-06,
"loss": -0.0025,
"num_tokens": 830090698.0,
"reward": 1.0667969048023225,
"reward_std": 0.1536639377474785,
"rewards/reward_accuracy/mean": 0.9671875,
"rewards/reward_accuracy/std": 0.15230460539460183,
"rewards/reward_format/mean": 0.09960937723517418,
"rewards/reward_format/std": 0.0029608421958982945,
"sampling/importance_sampling_ratio/max": 2.3962667107582094,
"sampling/importance_sampling_ratio/mean": 0.9852268040180207,
"sampling/importance_sampling_ratio/min": 0.1136434618383646,
"sampling/sampling_logp_difference/max": 0.9822579860687256,
"sampling/sampling_logp_difference/mean": 0.004079094924964011,
"step": 8090,
"step_time": 6.325762546784245
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1393.3,
"completions/max_terminated_length": 1174.1,
"completions/mean_length": 170.8875,
"completions/mean_terminated_length": 159.98683319091796,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.04905639525968582,
"epoch": 17.34475374732334,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.4765625,
"learning_rate": 9.1901e-06,
"loss": -0.0043,
"num_tokens": 831048122.0,
"reward": 1.065917980670929,
"reward_std": 0.12970841750502587,
"rewards/reward_accuracy/mean": 0.96640625,
"rewards/reward_accuracy/std": 0.12783292159438134,
"rewards/reward_format/mean": 0.09951172024011612,
"rewards/reward_format/std": 0.00401425720192492,
"sampling/importance_sampling_ratio/max": 2.5780307769775392,
"sampling/importance_sampling_ratio/mean": 0.9799639523029328,
"sampling/importance_sampling_ratio/min": 0.10376871079206466,
"sampling/sampling_logp_difference/max": 0.922963535785675,
"sampling/sampling_logp_difference/mean": 0.004214664199389517,
"step": 8100,
"step_time": 6.948960478487424
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1520.4,
"completions/max_terminated_length": 1336.9,
"completions/mean_length": 168.691796875,
"completions/mean_terminated_length": 154.8833038330078,
"completions/min_length": 65.2,
"completions/min_terminated_length": 65.2,
"entropy": 0.046236279606819156,
"epoch": 17.366167023554603,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.498046875,
"learning_rate": 9.189100000000002e-06,
"loss": -0.0023,
"num_tokens": 832000725.0,
"reward": 1.0650976777076722,
"reward_std": 0.14499300792813302,
"rewards/reward_accuracy/mean": 0.965625,
"rewards/reward_accuracy/std": 0.143001838773489,
"rewards/reward_format/mean": 0.0994726575911045,
"rewards/reward_format/std": 0.004446694138459861,
"sampling/importance_sampling_ratio/max": 2.5690616607666015,
"sampling/importance_sampling_ratio/mean": 0.9918439447879791,
"sampling/importance_sampling_ratio/min": 0.11133526428602636,
"sampling/sampling_logp_difference/max": 1.363012933731079,
"sampling/sampling_logp_difference/mean": 0.004074672353453934,
"step": 8110,
"step_time": 7.456481829303084
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1389.9,
"completions/max_terminated_length": 1084.0,
"completions/mean_length": 156.21640625,
"completions/mean_terminated_length": 146.6111618041992,
"completions/min_length": 67.4,
"completions/min_terminated_length": 67.4,
"entropy": 0.04201012558769435,
"epoch": 17.387580299785867,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.1728515625,
"learning_rate": 9.188100000000001e-06,
"loss": -0.0073,
"num_tokens": 832923055.0,
"reward": 1.0614453315734864,
"reward_std": 0.17362353429198266,
"rewards/reward_accuracy/mean": 0.96171875,
"rewards/reward_accuracy/std": 0.17186207249760627,
"rewards/reward_format/mean": 0.0997265636920929,
"rewards/reward_format/std": 0.0037368136923760175,
"sampling/importance_sampling_ratio/max": 2.434686779975891,
"sampling/importance_sampling_ratio/mean": 0.9849812150001526,
"sampling/importance_sampling_ratio/min": 0.12121579218655824,
"sampling/sampling_logp_difference/max": 1.072529911994934,
"sampling/sampling_logp_difference/mean": 0.003926744102500379,
"step": 8120,
"step_time": 6.852109160510008
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1895.2,
"completions/max_terminated_length": 1533.3,
"completions/mean_length": 172.1984375,
"completions/mean_terminated_length": 157.45965042114258,
"completions/min_length": 60.2,
"completions/min_terminated_length": 60.2,
"entropy": 0.0491838191403076,
"epoch": 17.40899357601713,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.0,
"learning_rate": 9.1871e-06,
"loss": -0.0042,
"num_tokens": 833889051.0,
"reward": 1.0564453125,
"reward_std": 0.17756492719054223,
"rewards/reward_accuracy/mean": 0.95703125,
"rewards/reward_accuracy/std": 0.17488315775990487,
"rewards/reward_format/mean": 0.0994140625,
"rewards/reward_format/std": 0.004677861742675304,
"sampling/importance_sampling_ratio/max": 2.5776376724243164,
"sampling/importance_sampling_ratio/mean": 0.9925845742225647,
"sampling/importance_sampling_ratio/min": 0.09387719742953778,
"sampling/sampling_logp_difference/max": 0.9087488949298859,
"sampling/sampling_logp_difference/mean": 0.00406003266107291,
"step": 8130,
"step_time": 9.030567594489549
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1968.6,
"completions/max_terminated_length": 1628.2,
"completions/mean_length": 193.301953125,
"completions/mean_terminated_length": 183.8826934814453,
"completions/min_length": 65.7,
"completions/min_terminated_length": 65.7,
"entropy": 0.05839116906281561,
"epoch": 17.430406852248392,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.75390625,
"learning_rate": 9.186100000000002e-06,
"loss": -0.004,
"num_tokens": 834909392.0,
"reward": 1.046113282442093,
"reward_std": 0.2054090015590191,
"rewards/reward_accuracy/mean": 0.946484375,
"rewards/reward_accuracy/std": 0.2033394120633602,
"rewards/reward_format/mean": 0.09962890669703484,
"rewards/reward_format/std": 0.004229986807331443,
"sampling/importance_sampling_ratio/max": 2.6494335412979124,
"sampling/importance_sampling_ratio/mean": 0.9820327818393707,
"sampling/importance_sampling_ratio/min": 0.0250747911632061,
"sampling/sampling_logp_difference/max": 1.2187644422054291,
"sampling/sampling_logp_difference/mean": 0.004577512270770967,
"step": 8140,
"step_time": 9.443231767500402
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1602.8,
"completions/max_terminated_length": 1443.5,
"completions/mean_length": 171.064453125,
"completions/mean_terminated_length": 160.94688568115234,
"completions/min_length": 64.4,
"completions/min_terminated_length": 64.4,
"entropy": 0.048230223124846816,
"epoch": 17.451820128479657,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.640625,
"learning_rate": 9.185100000000001e-06,
"loss": -0.01,
"num_tokens": 835860757.0,
"reward": 1.0611132860183716,
"reward_std": 0.16790748685598372,
"rewards/reward_accuracy/mean": 0.96171875,
"rewards/reward_accuracy/std": 0.16558668985962868,
"rewards/reward_format/mean": 0.09939453080296516,
"rewards/reward_format/std": 0.004780217190273106,
"sampling/importance_sampling_ratio/max": 2.3358971238136292,
"sampling/importance_sampling_ratio/mean": 0.9728877365589141,
"sampling/importance_sampling_ratio/min": 0.07094925949349999,
"sampling/sampling_logp_difference/max": 0.8971877217292785,
"sampling/sampling_logp_difference/mean": 0.004038160387426615,
"step": 8150,
"step_time": 7.756438562995754
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1475.4,
"completions/max_terminated_length": 1217.3,
"completions/mean_length": 148.515625,
"completions/mean_terminated_length": 142.59803009033203,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.039872558298520745,
"epoch": 17.47323340471092,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.3828125,
"learning_rate": 9.1841e-06,
"loss": 0.0029,
"num_tokens": 836749229.0,
"reward": 1.0712109684944153,
"reward_std": 0.14039576649665833,
"rewards/reward_accuracy/mean": 0.971484375,
"rewards/reward_accuracy/std": 0.1388804756104946,
"rewards/reward_format/mean": 0.0997265636920929,
"rewards/reward_format/std": 0.0033788751112297176,
"sampling/importance_sampling_ratio/max": 2.3292322874069216,
"sampling/importance_sampling_ratio/mean": 0.9788650929927826,
"sampling/importance_sampling_ratio/min": 0.10226080808788537,
"sampling/sampling_logp_difference/max": 0.8657418727874756,
"sampling/sampling_logp_difference/mean": 0.003872860292904079,
"step": 8160,
"step_time": 7.058806186995935
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1334.1,
"completions/max_terminated_length": 1295.5,
"completions/mean_length": 177.1140625,
"completions/mean_terminated_length": 168.4720657348633,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.05198611572850496,
"epoch": 17.494646680942186,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.0,
"learning_rate": 9.1831e-06,
"loss": -0.0086,
"num_tokens": 837723329.0,
"reward": 1.0369726896286011,
"reward_std": 0.20896882712841033,
"rewards/reward_accuracy/mean": 0.9375,
"rewards/reward_accuracy/std": 0.20730026960372924,
"rewards/reward_format/mean": 0.09947265908122063,
"rewards/reward_format/std": 0.004880250385031104,
"sampling/importance_sampling_ratio/max": 2.4738518953323365,
"sampling/importance_sampling_ratio/mean": 0.9810921847820282,
"sampling/importance_sampling_ratio/min": 0.08166157156229019,
"sampling/sampling_logp_difference/max": 1.065821099281311,
"sampling/sampling_logp_difference/mean": 0.004520977195352316,
"step": 8170,
"step_time": 6.742382194608217
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1436.1,
"completions/max_terminated_length": 1334.6,
"completions/mean_length": 165.350390625,
"completions/mean_terminated_length": 160.96797943115234,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.04382397264707834,
"epoch": 17.516059957173447,
"frac_reward_zero_std": 0.85625,
"grad_norm": 1.046875,
"learning_rate": 9.1821e-06,
"loss": -0.0077,
"num_tokens": 838662418.0,
"reward": 1.044648438692093,
"reward_std": 0.21346878707408906,
"rewards/reward_accuracy/mean": 0.944921875,
"rewards/reward_accuracy/std": 0.21237364113330842,
"rewards/reward_format/mean": 0.09972656294703483,
"rewards/reward_format/std": 0.0033384527312591674,
"sampling/importance_sampling_ratio/max": 2.451289987564087,
"sampling/importance_sampling_ratio/mean": 0.9904144883155823,
"sampling/importance_sampling_ratio/min": 0.11785658597946166,
"sampling/sampling_logp_difference/max": 0.9244058966636658,
"sampling/sampling_logp_difference/mean": 0.003974161855876446,
"step": 8180,
"step_time": 6.969666801192216
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1266.2,
"completions/max_terminated_length": 1160.7,
"completions/mean_length": 158.7984375,
"completions/mean_terminated_length": 153.70599212646485,
"completions/min_length": 66.3,
"completions/min_terminated_length": 66.3,
"entropy": 0.04589918227866292,
"epoch": 17.53747323340471,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.41015625,
"learning_rate": 9.181100000000001e-06,
"loss": -0.0119,
"num_tokens": 839587694.0,
"reward": 1.0686328291893006,
"reward_std": 0.14098459035158156,
"rewards/reward_accuracy/mean": 0.96875,
"rewards/reward_accuracy/std": 0.14047638773918153,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.0014512486523017287,
"sampling/importance_sampling_ratio/max": 2.3540929198265075,
"sampling/importance_sampling_ratio/mean": 0.977182000875473,
"sampling/importance_sampling_ratio/min": 0.05231004357337952,
"sampling/sampling_logp_difference/max": 1.1751423001289367,
"sampling/sampling_logp_difference/mean": 0.00411627977155149,
"step": 8190,
"step_time": 6.1910551680979555
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1409.8,
"completions/max_terminated_length": 1098.6,
"completions/mean_length": 163.6875,
"completions/mean_terminated_length": 155.64179534912108,
"completions/min_length": 64.7,
"completions/min_terminated_length": 64.7,
"entropy": 0.041514119249768555,
"epoch": 17.558886509635975,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.466796875,
"learning_rate": 9.1801e-06,
"loss": -0.0007,
"num_tokens": 840527006.0,
"reward": 1.0563476741313935,
"reward_std": 0.16237833499908447,
"rewards/reward_accuracy/mean": 0.956640625,
"rewards/reward_accuracy/std": 0.16107039153575897,
"rewards/reward_format/mean": 0.09970703274011612,
"rewards/reward_format/std": 0.003450417937710881,
"sampling/importance_sampling_ratio/max": 2.5172585129737852,
"sampling/importance_sampling_ratio/mean": 0.9840880632400513,
"sampling/importance_sampling_ratio/min": 0.11205626134760678,
"sampling/sampling_logp_difference/max": 0.8469281196594238,
"sampling/sampling_logp_difference/mean": 0.003842562437057495,
"step": 8200,
"step_time": 6.755654303909978
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.014738629441126e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.014738629441126e-06,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1441.3,
"completions/max_terminated_length": 1332.1,
"completions/mean_length": 183.81875,
"completions/mean_terminated_length": 164.83226623535157,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.05078675611875951,
"epoch": 17.580299785867236,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.061767578125,
"learning_rate": 9.179100000000002e-06,
"loss": -0.006,
"num_tokens": 841511454.0,
"reward": 1.0486914277076722,
"reward_std": 0.20336907356977463,
"rewards/reward_accuracy/mean": 0.949609375,
"rewards/reward_accuracy/std": 0.19995293989777566,
"rewards/reward_format/mean": 0.09908203184604644,
"rewards/reward_format/std": 0.0059956970624625685,
"sampling/importance_sampling_ratio/max": 2.506076288223267,
"sampling/importance_sampling_ratio/mean": 0.9790755093097687,
"sampling/importance_sampling_ratio/min": 0.08928759135305882,
"sampling/sampling_logp_difference/max": 1.0718903481960296,
"sampling/sampling_logp_difference/mean": 0.004155035177245736,
"step": 8210,
"step_time": 7.318360588492942
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1604.6,
"completions/max_terminated_length": 1420.1,
"completions/mean_length": 168.44453125,
"completions/mean_terminated_length": 159.68732452392578,
"completions/min_length": 63.9,
"completions/min_terminated_length": 63.9,
"entropy": 0.047775210719555615,
"epoch": 17.6017130620985,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.359375,
"learning_rate": 9.178100000000001e-06,
"loss": -0.0036,
"num_tokens": 842453040.0,
"reward": 1.0597070455551147,
"reward_std": 0.16970512941479682,
"rewards/reward_accuracy/mean": 0.96015625,
"rewards/reward_accuracy/std": 0.16800438910722731,
"rewards/reward_format/mean": 0.09955078214406968,
"rewards/reward_format/std": 0.0038216831162571907,
"sampling/importance_sampling_ratio/max": 2.535776901245117,
"sampling/importance_sampling_ratio/mean": 0.9895294904708862,
"sampling/importance_sampling_ratio/min": 0.09251640178263187,
"sampling/sampling_logp_difference/max": 1.2158201694488526,
"sampling/sampling_logp_difference/mean": 0.0042806789977476,
"step": 8220,
"step_time": 7.582698244106723
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1347.9,
"completions/max_terminated_length": 973.8,
"completions/mean_length": 152.101953125,
"completions/mean_terminated_length": 146.20602111816407,
"completions/min_length": 67.6,
"completions/min_terminated_length": 67.6,
"entropy": 0.04346271688118577,
"epoch": 17.623126338329765,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.46484375,
"learning_rate": 9.1771e-06,
"loss": 0.001,
"num_tokens": 843359301.0,
"reward": 1.0614843964576721,
"reward_std": 0.14244792610406876,
"rewards/reward_accuracy/mean": 0.96171875,
"rewards/reward_accuracy/std": 0.1411731630563736,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0031982232350856064,
"sampling/importance_sampling_ratio/max": 2.4833980202674866,
"sampling/importance_sampling_ratio/mean": 0.9903745949268341,
"sampling/importance_sampling_ratio/min": 0.1354645427316427,
"sampling/sampling_logp_difference/max": 0.9688260674476623,
"sampling/sampling_logp_difference/mean": 0.003999817022122443,
"step": 8230,
"step_time": 6.549545863815001
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1849.4,
"completions/max_terminated_length": 1328.9,
"completions/mean_length": 166.415234375,
"completions/mean_terminated_length": 152.44002685546874,
"completions/min_length": 71.2,
"completions/min_terminated_length": 71.2,
"entropy": 0.046314814640209076,
"epoch": 17.644539614561026,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.2890625,
"learning_rate": 9.176100000000002e-06,
"loss": -0.0127,
"num_tokens": 844310380.0,
"reward": 1.065917980670929,
"reward_std": 0.15051930651534348,
"rewards/reward_accuracy/mean": 0.96640625,
"rewards/reward_accuracy/std": 0.1474744535982609,
"rewards/reward_format/mean": 0.09951172024011612,
"rewards/reward_format/std": 0.005035247141495347,
"sampling/importance_sampling_ratio/max": 2.416418027877808,
"sampling/importance_sampling_ratio/mean": 0.9901250302791595,
"sampling/importance_sampling_ratio/min": 0.1198412261903286,
"sampling/sampling_logp_difference/max": 1.1021100401878356,
"sampling/sampling_logp_difference/mean": 0.004017347423359752,
"step": 8240,
"step_time": 8.653973220611807
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1165.8,
"completions/max_terminated_length": 985.2,
"completions/mean_length": 163.79765625,
"completions/mean_terminated_length": 155.84788360595704,
"completions/min_length": 68.1,
"completions/min_terminated_length": 68.1,
"entropy": 0.042624638648703694,
"epoch": 17.66595289079229,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.60546875,
"learning_rate": 9.175100000000001e-06,
"loss": -0.0017,
"num_tokens": 845253910.0,
"reward": 1.049609398841858,
"reward_std": 0.16161189079284669,
"rewards/reward_accuracy/mean": 0.95,
"rewards/reward_accuracy/std": 0.16041086465120316,
"rewards/reward_format/mean": 0.09960937649011611,
"rewards/reward_format/std": 0.003377661248669028,
"sampling/importance_sampling_ratio/max": 2.484706926345825,
"sampling/importance_sampling_ratio/mean": 0.9974665939807892,
"sampling/importance_sampling_ratio/min": 0.09628750607371331,
"sampling/sampling_logp_difference/max": 0.9164491057395935,
"sampling/sampling_logp_difference/mean": 0.004076571995392441,
"step": 8250,
"step_time": 5.945845928197377
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1460.8,
"completions/max_terminated_length": 1260.1,
"completions/mean_length": 162.611328125,
"completions/mean_terminated_length": 152.47344512939452,
"completions/min_length": 63.9,
"completions/min_terminated_length": 63.9,
"entropy": 0.04725247547030449,
"epoch": 17.687366167023555,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.22265625,
"learning_rate": 9.1741e-06,
"loss": -0.0092,
"num_tokens": 846187699.0,
"reward": 1.0502929866313935,
"reward_std": 0.19904604852199553,
"rewards/reward_accuracy/mean": 0.95078125,
"rewards/reward_accuracy/std": 0.19728218764066696,
"rewards/reward_format/mean": 0.09951171949505806,
"rewards/reward_format/std": 0.004509858973324299,
"sampling/importance_sampling_ratio/max": 2.4633562207221984,
"sampling/importance_sampling_ratio/mean": 0.986544406414032,
"sampling/importance_sampling_ratio/min": 0.1480050291866064,
"sampling/sampling_logp_difference/max": 0.9593998610973358,
"sampling/sampling_logp_difference/mean": 0.004211529553867876,
"step": 8260,
"step_time": 7.21387554378598
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1124.0,
"completions/max_terminated_length": 936.9,
"completions/mean_length": 145.98984375,
"completions/mean_terminated_length": 141.55275115966796,
"completions/min_length": 60.1,
"completions/min_terminated_length": 60.1,
"entropy": 0.03997024167329073,
"epoch": 17.70877944325482,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.2490234375,
"learning_rate": 9.1731e-06,
"loss": -0.0038,
"num_tokens": 847077529.0,
"reward": 1.081406259536743,
"reward_std": 0.10859995037317276,
"rewards/reward_accuracy/mean": 0.981640625,
"rewards/reward_accuracy/std": 0.10751550942659378,
"rewards/reward_format/mean": 0.09976562559604644,
"rewards/reward_format/std": 0.0026831001276150348,
"sampling/importance_sampling_ratio/max": 2.5217877626419067,
"sampling/importance_sampling_ratio/mean": 0.9951166331768035,
"sampling/importance_sampling_ratio/min": 0.12926680594682693,
"sampling/sampling_logp_difference/max": 1.0052352666854858,
"sampling/sampling_logp_difference/mean": 0.0038479633862152697,
"step": 8270,
"step_time": 5.5895788537076445
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1545.6,
"completions/max_terminated_length": 1179.2,
"completions/mean_length": 151.87734375,
"completions/mean_terminated_length": 147.4501708984375,
"completions/min_length": 63.1,
"completions/min_terminated_length": 63.1,
"entropy": 0.03860866376198828,
"epoch": 17.73019271948608,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.302734375,
"learning_rate": 9.1721e-06,
"loss": -0.0073,
"num_tokens": 847975551.0,
"reward": 1.0596289157867431,
"reward_std": 0.16422342509031296,
"rewards/reward_accuracy/mean": 0.959765625,
"rewards/reward_accuracy/std": 0.1632730945944786,
"rewards/reward_format/mean": 0.09986328184604645,
"rewards/reward_format/std": 0.002187500172294676,
"sampling/importance_sampling_ratio/max": 2.43781920671463,
"sampling/importance_sampling_ratio/mean": 0.9880088448524476,
"sampling/importance_sampling_ratio/min": 0.16354676689952613,
"sampling/sampling_logp_difference/max": 0.9417940855026246,
"sampling/sampling_logp_difference/mean": 0.0037146177142858504,
"step": 8280,
"step_time": 7.24372002131131
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1250.0,
"completions/max_terminated_length": 1178.4,
"completions/mean_length": 168.7046875,
"completions/mean_terminated_length": 156.42251281738282,
"completions/min_length": 60.0,
"completions/min_terminated_length": 60.0,
"entropy": 0.04477310441434383,
"epoch": 17.751605995717345,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.5390625,
"learning_rate": 9.171100000000001e-06,
"loss": -0.0038,
"num_tokens": 848927435.0,
"reward": 1.0643555045127868,
"reward_std": 0.13730233162641525,
"rewards/reward_accuracy/mean": 0.96484375,
"rewards/reward_accuracy/std": 0.13536398485302925,
"rewards/reward_format/mean": 0.09951172098517418,
"rewards/reward_format/std": 0.004053422063589096,
"sampling/importance_sampling_ratio/max": 2.606103944778442,
"sampling/importance_sampling_ratio/mean": 0.98892160654068,
"sampling/importance_sampling_ratio/min": 0.16752475686371326,
"sampling/sampling_logp_difference/max": 0.9576844453811646,
"sampling/sampling_logp_difference/mean": 0.004023877484723925,
"step": 8290,
"step_time": 6.30361013970105
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 1691.7,
"completions/max_terminated_length": 1496.7,
"completions/mean_length": 198.300390625,
"completions/mean_terminated_length": 176.55086364746094,
"completions/min_length": 64.4,
"completions/min_terminated_length": 64.4,
"entropy": 0.0544270928716287,
"epoch": 17.77301927194861,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.228515625,
"learning_rate": 9.1701e-06,
"loss": -0.0099,
"num_tokens": 849957548.0,
"reward": 1.0442578673362732,
"reward_std": 0.1997273236513138,
"rewards/reward_accuracy/mean": 0.9453125,
"rewards/reward_accuracy/std": 0.19600295796990394,
"rewards/reward_format/mean": 0.09894531592726707,
"rewards/reward_format/std": 0.007567788381129504,
"sampling/importance_sampling_ratio/max": 2.3480772495269777,
"sampling/importance_sampling_ratio/mean": 0.9694286227226258,
"sampling/importance_sampling_ratio/min": 0.06911256992025301,
"sampling/sampling_logp_difference/max": 1.0555625200271606,
"sampling/sampling_logp_difference/mean": 0.004147405037656426,
"step": 8300,
"step_time": 8.605465210197144
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1226.7,
"completions/max_terminated_length": 1118.6,
"completions/mean_length": 161.8828125,
"completions/mean_terminated_length": 156.84258728027345,
"completions/min_length": 62.8,
"completions/min_terminated_length": 62.8,
"entropy": 0.04458531693089753,
"epoch": 17.79443254817987,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.31640625,
"learning_rate": 9.1691e-06,
"loss": -0.006,
"num_tokens": 850893952.0,
"reward": 1.0586523473262788,
"reward_std": 0.14783504009246826,
"rewards/reward_accuracy/mean": 0.958984375,
"rewards/reward_accuracy/std": 0.14664415195584296,
"rewards/reward_format/mean": 0.0996679686009884,
"rewards/reward_format/std": 0.0028983533149585126,
"sampling/importance_sampling_ratio/max": 2.5086684465408324,
"sampling/importance_sampling_ratio/mean": 0.9976350128650665,
"sampling/importance_sampling_ratio/min": 0.16495320554822684,
"sampling/sampling_logp_difference/max": 0.8072502911090851,
"sampling/sampling_logp_difference/mean": 0.004002649849280715,
"step": 8310,
"step_time": 6.078960943419952
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1720.0,
"completions/max_terminated_length": 1431.1,
"completions/mean_length": 168.651171875,
"completions/mean_terminated_length": 147.94911499023436,
"completions/min_length": 60.1,
"completions/min_terminated_length": 60.1,
"entropy": 0.0485750189749524,
"epoch": 17.815845824411134,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.478515625,
"learning_rate": 9.168100000000001e-06,
"loss": -0.0106,
"num_tokens": 851834995.0,
"reward": 1.048320335149765,
"reward_std": 0.1952370025217533,
"rewards/reward_accuracy/mean": 0.94921875,
"rewards/reward_accuracy/std": 0.19115806147456169,
"rewards/reward_format/mean": 0.0991015650331974,
"rewards/reward_format/std": 0.007846996793523431,
"sampling/importance_sampling_ratio/max": 2.484836995601654,
"sampling/importance_sampling_ratio/mean": 0.9817761301994323,
"sampling/importance_sampling_ratio/min": 0.07548203985206783,
"sampling/sampling_logp_difference/max": 0.8360128164291382,
"sampling/sampling_logp_difference/mean": 0.004231687495484948,
"step": 8320,
"step_time": 8.439120065697352
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1634.0,
"completions/max_terminated_length": 1331.1,
"completions/mean_length": 176.741015625,
"completions/mean_terminated_length": 166.5425033569336,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.04706415443215519,
"epoch": 17.8372591006424,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.2255859375,
"learning_rate": 9.1671e-06,
"loss": -0.0106,
"num_tokens": 852806556.0,
"reward": 1.0540234625339509,
"reward_std": 0.17763087898492813,
"rewards/reward_accuracy/mean": 0.9546875,
"rewards/reward_accuracy/std": 0.17531865164637567,
"rewards/reward_format/mean": 0.09933593794703484,
"rewards/reward_format/std": 0.0054783116094768046,
"sampling/importance_sampling_ratio/max": 2.3855207204818725,
"sampling/importance_sampling_ratio/mean": 0.974895590543747,
"sampling/importance_sampling_ratio/min": 0.10503290295600891,
"sampling/sampling_logp_difference/max": 0.8621065139770507,
"sampling/sampling_logp_difference/mean": 0.004141583712771535,
"step": 8330,
"step_time": 7.954761585308006
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1795.2,
"completions/max_terminated_length": 1501.6,
"completions/mean_length": 182.470703125,
"completions/mean_terminated_length": 169.54893188476564,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.056943308422341944,
"epoch": 17.858672376873663,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.34765625,
"learning_rate": 9.166100000000002e-06,
"loss": -0.0105,
"num_tokens": 853790481.0,
"reward": 1.0435547232627869,
"reward_std": 0.1763870820403099,
"rewards/reward_accuracy/mean": 0.944140625,
"rewards/reward_accuracy/std": 0.17425091564655304,
"rewards/reward_format/mean": 0.09941406473517418,
"rewards/reward_format/std": 0.004621501825749874,
"sampling/importance_sampling_ratio/max": 2.45790057182312,
"sampling/importance_sampling_ratio/mean": 0.9843412101268768,
"sampling/importance_sampling_ratio/min": 0.15898739472031592,
"sampling/sampling_logp_difference/max": 0.9259390115737915,
"sampling/sampling_logp_difference/mean": 0.004748213430866599,
"step": 8340,
"step_time": 8.541898735900759
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.713299136303249e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.713299136303249e-06,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1397.7,
"completions/max_terminated_length": 1218.2,
"completions/mean_length": 167.815625,
"completions/mean_terminated_length": 150.4179473876953,
"completions/min_length": 62.5,
"completions/min_terminated_length": 62.5,
"entropy": 0.04569507855921984,
"epoch": 17.880085653104924,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.37109375,
"learning_rate": 9.165100000000001e-06,
"loss": -0.0042,
"num_tokens": 854726041.0,
"reward": 1.066464865207672,
"reward_std": 0.14693954288959504,
"rewards/reward_accuracy/mean": 0.9671875,
"rewards/reward_accuracy/std": 0.14435612335801123,
"rewards/reward_format/mean": 0.0992773450911045,
"rewards/reward_format/std": 0.004629110544919967,
"sampling/importance_sampling_ratio/max": 2.568280816078186,
"sampling/importance_sampling_ratio/mean": 0.9893718779087066,
"sampling/importance_sampling_ratio/min": 0.08189501017332076,
"sampling/sampling_logp_difference/max": 1.147831630706787,
"sampling/sampling_logp_difference/mean": 0.004230017052032053,
"step": 8350,
"step_time": 6.957513730117353
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1485.8,
"completions/max_terminated_length": 959.8,
"completions/mean_length": 154.16484375,
"completions/mean_terminated_length": 145.40194396972657,
"completions/min_length": 61.7,
"completions/min_terminated_length": 61.7,
"entropy": 0.04410214265808463,
"epoch": 17.90149892933619,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.24609375,
"learning_rate": 9.164100000000001e-06,
"loss": -0.0103,
"num_tokens": 855639487.0,
"reward": 1.059335970878601,
"reward_std": 0.17857150733470917,
"rewards/reward_accuracy/mean": 0.959765625,
"rewards/reward_accuracy/std": 0.17657126784324645,
"rewards/reward_format/mean": 0.09957031309604644,
"rewards/reward_format/std": 0.004549821373075247,
"sampling/importance_sampling_ratio/max": 2.25142103433609,
"sampling/importance_sampling_ratio/mean": 0.983077073097229,
"sampling/importance_sampling_ratio/min": 0.09560363888740539,
"sampling/sampling_logp_difference/max": 0.8792935729026794,
"sampling/sampling_logp_difference/mean": 0.004171370388939976,
"step": 8360,
"step_time": 7.133393535399227
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1479.3,
"completions/max_terminated_length": 1232.9,
"completions/mean_length": 150.8296875,
"completions/mean_terminated_length": 147.8700408935547,
"completions/min_length": 70.7,
"completions/min_terminated_length": 70.7,
"entropy": 0.04139857625123113,
"epoch": 17.922912205567453,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.26171875,
"learning_rate": 9.1631e-06,
"loss": -0.002,
"num_tokens": 856544171.0,
"reward": 1.0593164205551147,
"reward_std": 0.1525036233710125,
"rewards/reward_accuracy/mean": 0.959375,
"rewards/reward_accuracy/std": 0.15202652513980866,
"rewards/reward_format/mean": 0.09994140714406967,
"rewards/reward_format/std": 0.0009375000605359674,
"sampling/importance_sampling_ratio/max": 2.418799579143524,
"sampling/importance_sampling_ratio/mean": 0.9861987709999085,
"sampling/importance_sampling_ratio/min": 0.12147632464766503,
"sampling/sampling_logp_difference/max": 0.9672939538955688,
"sampling/sampling_logp_difference/mean": 0.004212145740166306,
"step": 8370,
"step_time": 7.0183396212029034
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 4.71318389827502e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.71318389827502e-06,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1665.2,
"completions/max_terminated_length": 1315.1,
"completions/mean_length": 169.032421875,
"completions/mean_terminated_length": 152.12120361328124,
"completions/min_length": 67.1,
"completions/min_terminated_length": 67.1,
"entropy": 0.05248430648352951,
"epoch": 17.944325481798714,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 9.1621e-06,
"loss": -0.0024,
"num_tokens": 857489454.0,
"reward": 1.0454101860523224,
"reward_std": 0.19547022581100465,
"rewards/reward_accuracy/mean": 0.94609375,
"rewards/reward_accuracy/std": 0.19271953403949738,
"rewards/reward_format/mean": 0.09931640774011612,
"rewards/reward_format/std": 0.005737062031403184,
"sampling/importance_sampling_ratio/max": 2.4733829140663146,
"sampling/importance_sampling_ratio/mean": 0.9763400256633759,
"sampling/importance_sampling_ratio/min": 0.13519520182162523,
"sampling/sampling_logp_difference/max": 0.8551467180252075,
"sampling/sampling_logp_difference/mean": 0.004326293803751468,
"step": 8380,
"step_time": 8.09949419858749
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1620.2,
"completions/max_terminated_length": 1420.2,
"completions/mean_length": 181.05078125,
"completions/mean_terminated_length": 167.94381256103514,
"completions/min_length": 63.9,
"completions/min_terminated_length": 63.9,
"entropy": 0.05943263911176473,
"epoch": 17.96573875802998,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.59765625,
"learning_rate": 9.161100000000001e-06,
"loss": -0.0066,
"num_tokens": 858476336.0,
"reward": 1.0638086080551148,
"reward_std": 0.15637133941054343,
"rewards/reward_accuracy/mean": 0.964453125,
"rewards/reward_accuracy/std": 0.15383390039205552,
"rewards/reward_format/mean": 0.09935546964406967,
"rewards/reward_format/std": 0.005785896838642657,
"sampling/importance_sampling_ratio/max": 2.5741005897521974,
"sampling/importance_sampling_ratio/mean": 0.9832662403583526,
"sampling/importance_sampling_ratio/min": 0.07790184915065765,
"sampling/sampling_logp_difference/max": 1.1753110826015472,
"sampling/sampling_logp_difference/mean": 0.0046984185464680195,
"step": 8390,
"step_time": 7.989136365993181
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1542.0,
"completions/max_terminated_length": 1399.8,
"completions/mean_length": 159.673828125,
"completions/mean_terminated_length": 154.54903411865234,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.04844827032648027,
"epoch": 17.987152034261243,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.75,
"learning_rate": 9.1601e-06,
"loss": -0.006,
"num_tokens": 859407789.0,
"reward": 1.0692773461341858,
"reward_std": 0.14208532378543168,
"rewards/reward_accuracy/mean": 0.96953125,
"rewards/reward_accuracy/std": 0.14065084978938103,
"rewards/reward_format/mean": 0.09974609389901161,
"rewards/reward_format/std": 0.0023240380687639117,
"sampling/importance_sampling_ratio/max": 2.4725154042243958,
"sampling/importance_sampling_ratio/mean": 0.9846623480319977,
"sampling/importance_sampling_ratio/min": 0.0801173135638237,
"sampling/sampling_logp_difference/max": 1.0163818836212157,
"sampling/sampling_logp_difference/mean": 0.004249382973648607,
"step": 8400,
"step_time": 7.275318749505095
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1670.1,
"completions/max_terminated_length": 1388.5,
"completions/mean_length": 167.784765625,
"completions/mean_terminated_length": 157.54922790527343,
"completions/min_length": 70.1,
"completions/min_terminated_length": 70.1,
"entropy": 0.045404623704962434,
"epoch": 18.008565310492504,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.50390625,
"learning_rate": 9.1591e-06,
"loss": -0.0121,
"num_tokens": 860355734.0,
"reward": 1.0558984518051147,
"reward_std": 0.1844407543540001,
"rewards/reward_accuracy/mean": 0.95625,
"rewards/reward_accuracy/std": 0.18285638988018035,
"rewards/reward_format/mean": 0.09964843913912773,
"rewards/reward_format/std": 0.0037112545222043993,
"sampling/importance_sampling_ratio/max": 2.6140115737915037,
"sampling/importance_sampling_ratio/mean": 0.9959035515785217,
"sampling/importance_sampling_ratio/min": 0.07228115182369947,
"sampling/sampling_logp_difference/max": 0.9848323941230774,
"sampling/sampling_logp_difference/mean": 0.004173437575809657,
"step": 8410,
"step_time": 7.967428772296989
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.010546875,
"completions/max_length": 1690.2,
"completions/max_terminated_length": 1232.1,
"completions/mean_length": 177.93984375,
"completions/mean_terminated_length": 158.21025543212892,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.05244099779520184,
"epoch": 18.029978586723768,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.1904296875,
"learning_rate": 9.158100000000001e-06,
"loss": -0.0095,
"num_tokens": 861329628.0,
"reward": 1.0677148580551148,
"reward_std": 0.14995749220252036,
"rewards/reward_accuracy/mean": 0.968359375,
"rewards/reward_accuracy/std": 0.14673361629247667,
"rewards/reward_format/mean": 0.09935546964406967,
"rewards/reward_format/std": 0.006172568630427122,
"sampling/importance_sampling_ratio/max": 2.4172771692276003,
"sampling/importance_sampling_ratio/mean": 0.9897995233535767,
"sampling/importance_sampling_ratio/min": 0.15345925148576497,
"sampling/sampling_logp_difference/max": 0.9060311555862427,
"sampling/sampling_logp_difference/mean": 0.004403009847737849,
"step": 8420,
"step_time": 8.169427076607827
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1094.0,
"completions/max_terminated_length": 872.9,
"completions/mean_length": 149.305078125,
"completions/mean_terminated_length": 145.61585235595703,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.03948886764701456,
"epoch": 18.051391862955033,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.2373046875,
"learning_rate": 9.1571e-06,
"loss": -0.0027,
"num_tokens": 862226553.0,
"reward": 1.0827148675918579,
"reward_std": 0.10124944597482681,
"rewards/reward_accuracy/mean": 0.9828125,
"rewards/reward_accuracy/std": 0.10068337619304657,
"rewards/reward_format/mean": 0.09990234524011612,
"rewards/reward_format/std": 0.0010754599468782544,
"sampling/importance_sampling_ratio/max": 2.507240343093872,
"sampling/importance_sampling_ratio/mean": 0.9829702854156495,
"sampling/importance_sampling_ratio/min": 0.13182338923215867,
"sampling/sampling_logp_difference/max": 1.0012905597686768,
"sampling/sampling_logp_difference/mean": 0.0040485898964107035,
"step": 8430,
"step_time": 5.394941871680203
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1215.3,
"completions/max_terminated_length": 1109.0,
"completions/mean_length": 155.6078125,
"completions/mean_terminated_length": 148.29960174560546,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.04485269191209227,
"epoch": 18.072805139186297,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.203125,
"learning_rate": 9.1561e-06,
"loss": -0.0045,
"num_tokens": 863140541.0,
"reward": 1.0816211342811584,
"reward_std": 0.11796165406703948,
"rewards/reward_accuracy/mean": 0.98203125,
"rewards/reward_accuracy/std": 0.11637364998459816,
"rewards/reward_format/mean": 0.09958984553813935,
"rewards/reward_format/std": 0.0034587712259963157,
"sampling/importance_sampling_ratio/max": 2.397448706626892,
"sampling/importance_sampling_ratio/mean": 0.9966842651367187,
"sampling/importance_sampling_ratio/min": 0.15866509452462196,
"sampling/sampling_logp_difference/max": 1.0440070867538451,
"sampling/sampling_logp_difference/mean": 0.004156065476126969,
"step": 8440,
"step_time": 6.13217083849886
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1423.9,
"completions/max_terminated_length": 1331.7,
"completions/mean_length": 178.771484375,
"completions/mean_terminated_length": 165.0561950683594,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.0489035181934014,
"epoch": 18.094218415417558,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.283203125,
"learning_rate": 9.155100000000002e-06,
"loss": -0.0043,
"num_tokens": 864118836.0,
"reward": 1.0497461080551147,
"reward_std": 0.20255809500813485,
"rewards/reward_accuracy/mean": 0.950390625,
"rewards/reward_accuracy/std": 0.20002903789281845,
"rewards/reward_format/mean": 0.09935546964406967,
"rewards/reward_format/std": 0.004749238467775285,
"sampling/importance_sampling_ratio/max": 2.4780894994735716,
"sampling/importance_sampling_ratio/mean": 0.9727890491485596,
"sampling/importance_sampling_ratio/min": 0.12801228426396846,
"sampling/sampling_logp_difference/max": 0.887476772069931,
"sampling/sampling_logp_difference/mean": 0.004292128072120249,
"step": 8450,
"step_time": 7.232624618109549
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1640.5,
"completions/max_terminated_length": 1259.6,
"completions/mean_length": 159.080078125,
"completions/mean_terminated_length": 154.64983367919922,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.04324261446017772,
"epoch": 18.115631691648822,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.2470703125,
"learning_rate": 9.154100000000001e-06,
"loss": -0.0076,
"num_tokens": 865045697.0,
"reward": 1.0106836140155793,
"reward_std": 0.24634804651141168,
"rewards/reward_accuracy/mean": 0.9109375,
"rewards/reward_accuracy/std": 0.24534667581319808,
"rewards/reward_format/mean": 0.09974609538912774,
"rewards/reward_format/std": 0.0034548231400549413,
"sampling/importance_sampling_ratio/max": 2.4453017950057983,
"sampling/importance_sampling_ratio/mean": 0.9952467024326325,
"sampling/importance_sampling_ratio/min": 0.1551963571459055,
"sampling/sampling_logp_difference/max": 1.009485137462616,
"sampling/sampling_logp_difference/mean": 0.004133505700156093,
"step": 8460,
"step_time": 7.862117032791138
},
{
"clip_ratio/high_max": 1.4053967606741936e-05,
"clip_ratio/high_mean": 1.756745950842742e-06,
"clip_ratio/low_mean": 2.1114306946401485e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.8681766454828905e-06,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1410.9,
"completions/max_terminated_length": 1170.2,
"completions/mean_length": 158.7484375,
"completions/mean_terminated_length": 144.01522064208984,
"completions/min_length": 62.1,
"completions/min_terminated_length": 62.1,
"entropy": 0.04309529417660087,
"epoch": 18.137044967880087,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.46484375,
"learning_rate": 9.1531e-06,
"loss": -0.0037,
"num_tokens": 865968333.0,
"reward": 1.0629687666893006,
"reward_std": 0.15187642946839333,
"rewards/reward_accuracy/mean": 0.963671875,
"rewards/reward_accuracy/std": 0.14867664501070976,
"rewards/reward_format/mean": 0.09929687604308128,
"rewards/reward_format/std": 0.004409412038512528,
"sampling/importance_sampling_ratio/max": 2.194634568691254,
"sampling/importance_sampling_ratio/mean": 0.9682331383228302,
"sampling/importance_sampling_ratio/min": 0.1169423595070839,
"sampling/sampling_logp_difference/max": 0.9323523044586182,
"sampling/sampling_logp_difference/mean": 0.0037279321579262613,
"step": 8470,
"step_time": 6.860853795500589
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1567.4,
"completions/max_terminated_length": 1426.6,
"completions/mean_length": 184.30703125,
"completions/mean_terminated_length": 175.0118606567383,
"completions/min_length": 63.2,
"completions/min_terminated_length": 63.2,
"entropy": 0.05197924245148897,
"epoch": 18.158458244111348,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.4375,
"learning_rate": 9.1521e-06,
"loss": -0.0057,
"num_tokens": 866967055.0,
"reward": 1.0429296970367432,
"reward_std": 0.2063838168978691,
"rewards/reward_accuracy/mean": 0.943359375,
"rewards/reward_accuracy/std": 0.20487484559416771,
"rewards/reward_format/mean": 0.09957031309604644,
"rewards/reward_format/std": 0.004249469796195626,
"sampling/importance_sampling_ratio/max": 2.494518458843231,
"sampling/importance_sampling_ratio/mean": 0.9778971612453461,
"sampling/importance_sampling_ratio/min": 0.06931855082511902,
"sampling/sampling_logp_difference/max": 1.2850203275680543,
"sampling/sampling_logp_difference/mean": 0.004400036227889359,
"step": 8480,
"step_time": 7.949689297311124
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1423.6,
"completions/max_terminated_length": 1364.7,
"completions/mean_length": 175.20859375,
"completions/mean_terminated_length": 167.95795745849608,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.04807736191432923,
"epoch": 18.179871520342612,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.275390625,
"learning_rate": 9.151100000000001e-06,
"loss": -0.0052,
"num_tokens": 867940645.0,
"reward": 1.0487890601158143,
"reward_std": 0.20246227756142615,
"rewards/reward_accuracy/mean": 0.94921875,
"rewards/reward_accuracy/std": 0.2007620617747307,
"rewards/reward_format/mean": 0.09957031160593033,
"rewards/reward_format/std": 0.0037796362536028027,
"sampling/importance_sampling_ratio/max": 2.4190810084342957,
"sampling/importance_sampling_ratio/mean": 0.9824954330921173,
"sampling/importance_sampling_ratio/min": 0.08894992023706436,
"sampling/sampling_logp_difference/max": 0.9808427572250367,
"sampling/sampling_logp_difference/mean": 0.00420389783103019,
"step": 8490,
"step_time": 7.054876831773436
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1690.6,
"completions/max_terminated_length": 1369.4,
"completions/mean_length": 171.243359375,
"completions/mean_terminated_length": 164.65916137695314,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.051826923107728365,
"epoch": 18.201284796573876,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.09326171875,
"learning_rate": 9.1501e-06,
"loss": -0.0061,
"num_tokens": 868892644.0,
"reward": 1.0648632943630219,
"reward_std": 0.1561727873980999,
"rewards/reward_accuracy/mean": 0.965234375,
"rewards/reward_accuracy/std": 0.15437662303447724,
"rewards/reward_format/mean": 0.09962890744209289,
"rewards/reward_format/std": 0.003653077222406864,
"sampling/importance_sampling_ratio/max": 2.6353787660598753,
"sampling/importance_sampling_ratio/mean": 0.9812964498996735,
"sampling/importance_sampling_ratio/min": 0.06284817159175873,
"sampling/sampling_logp_difference/max": 0.931235384941101,
"sampling/sampling_logp_difference/mean": 0.00430159221868962,
"step": 8500,
"step_time": 7.930065969304996
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1286.7,
"completions/max_terminated_length": 1074.4,
"completions/mean_length": 149.97890625,
"completions/mean_terminated_length": 147.0322265625,
"completions/min_length": 69.1,
"completions/min_terminated_length": 69.1,
"entropy": 0.04296927077230066,
"epoch": 18.22269807280514,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.11767578125,
"learning_rate": 9.1491e-06,
"loss": -0.006,
"num_tokens": 869796174.0,
"reward": 1.0647070467472077,
"reward_std": 0.13903171867132186,
"rewards/reward_accuracy/mean": 0.96484375,
"rewards/reward_accuracy/std": 0.13804719224572182,
"rewards/reward_format/mean": 0.09986328259110451,
"rewards/reward_format/std": 0.0017004600027576088,
"sampling/importance_sampling_ratio/max": 2.5176496863365174,
"sampling/importance_sampling_ratio/mean": 0.9885579168796539,
"sampling/importance_sampling_ratio/min": 0.13337359372526408,
"sampling/sampling_logp_difference/max": 0.8752417802810669,
"sampling/sampling_logp_difference/mean": 0.004053684999234974,
"step": 8510,
"step_time": 6.165357400491485
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1217.5,
"completions/max_terminated_length": 1047.2,
"completions/mean_length": 148.681640625,
"completions/mean_terminated_length": 145.7134796142578,
"completions/min_length": 62.1,
"completions/min_terminated_length": 62.1,
"entropy": 0.041143091348931196,
"epoch": 18.2441113490364,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.68359375,
"learning_rate": 9.148100000000001e-06,
"loss": -0.0019,
"num_tokens": 870689343.0,
"reward": 1.0877344012260437,
"reward_std": 0.09937636107206345,
"rewards/reward_accuracy/mean": 0.987890625,
"rewards/reward_accuracy/std": 0.09856762513518333,
"rewards/reward_format/mean": 0.09984375163912773,
"rewards/reward_format/std": 0.0017731342697516084,
"sampling/importance_sampling_ratio/max": 2.5103798866271974,
"sampling/importance_sampling_ratio/mean": 0.9862752497196198,
"sampling/importance_sampling_ratio/min": 0.1218482255935669,
"sampling/sampling_logp_difference/max": 0.8529219388961792,
"sampling/sampling_logp_difference/mean": 0.004052158631384373,
"step": 8520,
"step_time": 5.820051057008095
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1636.3,
"completions/max_terminated_length": 1084.0,
"completions/mean_length": 159.198828125,
"completions/mean_terminated_length": 150.35723114013672,
"completions/min_length": 63.2,
"completions/min_terminated_length": 63.2,
"entropy": 0.04152822191826999,
"epoch": 18.265524625267666,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.208984375,
"learning_rate": 9.147100000000001e-06,
"loss": -0.009,
"num_tokens": 871616764.0,
"reward": 1.0535351753234863,
"reward_std": 0.18972219303250312,
"rewards/reward_accuracy/mean": 0.95390625,
"rewards/reward_accuracy/std": 0.1877732366323471,
"rewards/reward_format/mean": 0.09962890744209289,
"rewards/reward_format/std": 0.0033354965271428227,
"sampling/importance_sampling_ratio/max": 2.572454881668091,
"sampling/importance_sampling_ratio/mean": 0.9845075666904449,
"sampling/importance_sampling_ratio/min": 0.12856173776090146,
"sampling/sampling_logp_difference/max": 1.0396783471107482,
"sampling/sampling_logp_difference/mean": 0.004218765161931514,
"step": 8530,
"step_time": 7.664251924798009
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1577.0,
"completions/max_terminated_length": 1267.6,
"completions/mean_length": 166.8125,
"completions/mean_terminated_length": 157.26136169433593,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.043240712932311,
"epoch": 18.28693790149893,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.796875,
"learning_rate": 9.1461e-06,
"loss": -0.0011,
"num_tokens": 872557532.0,
"reward": 1.043222677707672,
"reward_std": 0.19183254688978196,
"rewards/reward_accuracy/mean": 0.94375,
"rewards/reward_accuracy/std": 0.18960458934307098,
"rewards/reward_format/mean": 0.0994726575911045,
"rewards/reward_format/std": 0.004853535257279873,
"sampling/importance_sampling_ratio/max": 2.537194323539734,
"sampling/importance_sampling_ratio/mean": 0.9957084774971008,
"sampling/importance_sampling_ratio/min": 0.185854035615921,
"sampling/sampling_logp_difference/max": 0.9228651046752929,
"sampling/sampling_logp_difference/mean": 0.0038768432335928083,
"step": 8540,
"step_time": 7.671096479397965
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1589.1,
"completions/max_terminated_length": 1467.9,
"completions/mean_length": 168.206640625,
"completions/mean_terminated_length": 162.4131317138672,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.04576845755800605,
"epoch": 18.30835117773019,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.11962890625,
"learning_rate": 9.145100000000002e-06,
"loss": 0.0049,
"num_tokens": 873511421.0,
"reward": 1.0547461032867431,
"reward_std": 0.16764646202791483,
"rewards/reward_accuracy/mean": 0.955078125,
"rewards/reward_accuracy/std": 0.16596630662679673,
"rewards/reward_format/mean": 0.09966796934604645,
"rewards/reward_format/std": 0.0037306495709344746,
"sampling/importance_sampling_ratio/max": 2.4058130264282225,
"sampling/importance_sampling_ratio/mean": 1.000846928358078,
"sampling/importance_sampling_ratio/min": 0.11171788945794106,
"sampling/sampling_logp_difference/max": 0.9704546093940735,
"sampling/sampling_logp_difference/mean": 0.004158370057120919,
"step": 8550,
"step_time": 7.655849063716596
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1121.7,
"completions/max_terminated_length": 1075.3,
"completions/mean_length": 163.496484375,
"completions/mean_terminated_length": 151.9055160522461,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.04444409145507962,
"epoch": 18.329764453961456,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.412109375,
"learning_rate": 9.1441e-06,
"loss": -0.0042,
"num_tokens": 874446436.0,
"reward": 1.0598437666893006,
"reward_std": 0.1578107587993145,
"rewards/reward_accuracy/mean": 0.96015625,
"rewards/reward_accuracy/std": 0.15704872757196425,
"rewards/reward_format/mean": 0.09968750104308129,
"rewards/reward_format/std": 0.002388068032450974,
"sampling/importance_sampling_ratio/max": 2.562074613571167,
"sampling/importance_sampling_ratio/mean": 0.9858137309551239,
"sampling/importance_sampling_ratio/min": 0.08412972837686539,
"sampling/sampling_logp_difference/max": 1.150586450099945,
"sampling/sampling_logp_difference/mean": 0.00413800363894552,
"step": 8560,
"step_time": 5.61086009380233
},
{
"clip_ratio/high_max": 2.3170796339400113e-05,
"clip_ratio/high_mean": 2.896349542425014e-06,
"clip_ratio/low_mean": 3.44390559803287e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.240740102228301e-06,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1560.3,
"completions/max_terminated_length": 1409.7,
"completions/mean_length": 175.027734375,
"completions/mean_terminated_length": 154.50375366210938,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.04786982461810112,
"epoch": 18.35117773019272,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.388671875,
"learning_rate": 9.1431e-06,
"loss": -0.006,
"num_tokens": 875405819.0,
"reward": 1.044121128320694,
"reward_std": 0.19861215278506278,
"rewards/reward_accuracy/mean": 0.944921875,
"rewards/reward_accuracy/std": 0.1955738201737404,
"rewards/reward_format/mean": 0.09919922053813934,
"rewards/reward_format/std": 0.005896784598007798,
"sampling/importance_sampling_ratio/max": 2.6213974952697754,
"sampling/importance_sampling_ratio/mean": 0.976845920085907,
"sampling/importance_sampling_ratio/min": 0.1035877994261682,
"sampling/sampling_logp_difference/max": 1.1010785460472108,
"sampling/sampling_logp_difference/mean": 0.004242875799536705,
"step": 8570,
"step_time": 7.713991008276935
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1339.9,
"completions/max_terminated_length": 1143.1,
"completions/mean_length": 166.657421875,
"completions/mean_terminated_length": 157.18639068603517,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"entropy": 0.046134067908860744,
"epoch": 18.37259100642398,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.40625,
"learning_rate": 9.1421e-06,
"loss": -0.0035,
"num_tokens": 876349214.0,
"reward": 1.0686914265155791,
"reward_std": 0.12155143469572068,
"rewards/reward_accuracy/mean": 0.969140625,
"rewards/reward_accuracy/std": 0.11989398896694184,
"rewards/reward_format/mean": 0.0995507813990116,
"rewards/reward_format/std": 0.004080882505513727,
"sampling/importance_sampling_ratio/max": 2.4071941018104552,
"sampling/importance_sampling_ratio/mean": 0.9828149557113648,
"sampling/importance_sampling_ratio/min": 0.051990370452404025,
"sampling/sampling_logp_difference/max": 1.1543290555477141,
"sampling/sampling_logp_difference/mean": 0.004263247363269329,
"step": 8580,
"step_time": 6.629249561508186
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1508.0,
"completions/max_terminated_length": 961.4,
"completions/mean_length": 160.819921875,
"completions/mean_terminated_length": 154.89410400390625,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"entropy": 0.03990651173517108,
"epoch": 18.394004282655246,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.55859375,
"learning_rate": 9.141100000000001e-06,
"loss": -0.0032,
"num_tokens": 877281473.0,
"reward": 1.0575976610183715,
"reward_std": 0.1685032308101654,
"rewards/reward_accuracy/mean": 0.9578125,
"rewards/reward_accuracy/std": 0.16749053820967674,
"rewards/reward_format/mean": 0.09978515654802322,
"rewards/reward_format/std": 0.0030696488218382003,
"sampling/importance_sampling_ratio/max": 2.376018702983856,
"sampling/importance_sampling_ratio/mean": 0.9854066491127014,
"sampling/importance_sampling_ratio/min": 0.10967017933726311,
"sampling/sampling_logp_difference/max": 1.0564433097839356,
"sampling/sampling_logp_difference/mean": 0.003676741127856076,
"step": 8590,
"step_time": 7.10733306898328
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1210.3,
"completions/max_terminated_length": 1123.4,
"completions/mean_length": 157.7171875,
"completions/mean_terminated_length": 152.54615936279296,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.04217505711130798,
"epoch": 18.41541755888651,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.2197265625,
"learning_rate": 9.1401e-06,
"loss": -0.0048,
"num_tokens": 878198045.0,
"reward": 1.0743359565734862,
"reward_std": 0.11905328631401062,
"rewards/reward_accuracy/mean": 0.974609375,
"rewards/reward_accuracy/std": 0.11790348589420319,
"rewards/reward_format/mean": 0.09972656294703483,
"rewards/reward_format/std": 0.00239671238232404,
"sampling/importance_sampling_ratio/max": 2.384293723106384,
"sampling/importance_sampling_ratio/mean": 0.9835129082202911,
"sampling/importance_sampling_ratio/min": 0.02905181683599949,
"sampling/sampling_logp_difference/max": 0.9519108533859253,
"sampling/sampling_logp_difference/mean": 0.004050532262772322,
"step": 8600,
"step_time": 6.052885682313354
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1503.0,
"completions/max_terminated_length": 1108.8,
"completions/mean_length": 159.962109375,
"completions/mean_terminated_length": 151.14485626220704,
"completions/min_length": 67.9,
"completions/min_terminated_length": 67.9,
"entropy": 0.040847976529039445,
"epoch": 18.436830835117775,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.111328125,
"learning_rate": 9.1391e-06,
"loss": -0.0061,
"num_tokens": 879128796.0,
"reward": 1.066503930091858,
"reward_std": 0.15986426025629044,
"rewards/reward_accuracy/mean": 0.966796875,
"rewards/reward_accuracy/std": 0.15825553387403488,
"rewards/reward_format/mean": 0.09970703199505807,
"rewards/reward_format/std": 0.0029101309133693575,
"sampling/importance_sampling_ratio/max": 2.5423968553543093,
"sampling/importance_sampling_ratio/mean": 0.9952575087547302,
"sampling/importance_sampling_ratio/min": 0.07426697887185582,
"sampling/sampling_logp_difference/max": 1.699391508102417,
"sampling/sampling_logp_difference/mean": 0.00415060946252197,
"step": 8610,
"step_time": 7.251291197809041
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1340.7,
"completions/max_terminated_length": 969.2,
"completions/mean_length": 166.471484375,
"completions/mean_terminated_length": 155.58936614990233,
"completions/min_length": 64.4,
"completions/min_terminated_length": 64.4,
"entropy": 0.044167897361330685,
"epoch": 18.458244111349035,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.1005859375,
"learning_rate": 9.138100000000001e-06,
"loss": -0.0062,
"num_tokens": 880066547.0,
"reward": 1.0674609661102294,
"reward_std": 0.13675285279750823,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.13418496549129486,
"rewards/reward_format/mean": 0.0994921900331974,
"rewards/reward_format/std": 0.004411076474934816,
"sampling/importance_sampling_ratio/max": 2.4380250096321108,
"sampling/importance_sampling_ratio/mean": 0.9903872609138489,
"sampling/importance_sampling_ratio/min": 0.12321604192256927,
"sampling/sampling_logp_difference/max": 0.8484362721443176,
"sampling/sampling_logp_difference/mean": 0.0038369611371308564,
"step": 8620,
"step_time": 6.883035951096099
},
{
"clip_ratio/high_max": 1.5227082622004673e-05,
"clip_ratio/high_mean": 1.9033853277505842e-06,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.9033853277505842e-06,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 808.3,
"completions/max_terminated_length": 725.9,
"completions/mean_length": 147.3578125,
"completions/mean_terminated_length": 139.2431213378906,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.04090734755154699,
"epoch": 18.4796573875803,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.251953125,
"learning_rate": 9.137100000000001e-06,
"loss": -0.0015,
"num_tokens": 880963783.0,
"reward": 1.058359396457672,
"reward_std": 0.12359218746423721,
"rewards/reward_accuracy/mean": 0.95859375,
"rewards/reward_accuracy/std": 0.12293190211057663,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.001852018851786852,
"sampling/importance_sampling_ratio/max": 2.574910020828247,
"sampling/importance_sampling_ratio/mean": 0.9848734676837921,
"sampling/importance_sampling_ratio/min": 0.14049247382208704,
"sampling/sampling_logp_difference/max": 0.8857405364513398,
"sampling/sampling_logp_difference/mean": 0.004174930672161281,
"step": 8630,
"step_time": 4.400264114094898
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1448.2,
"completions/max_terminated_length": 1045.3,
"completions/mean_length": 156.02109375,
"completions/mean_terminated_length": 148.65486679077148,
"completions/min_length": 66.3,
"completions/min_terminated_length": 66.3,
"entropy": 0.0404561256757006,
"epoch": 18.501070663811564,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.70703125,
"learning_rate": 9.1361e-06,
"loss": -0.0073,
"num_tokens": 881882925.0,
"reward": 1.07861328125,
"reward_std": 0.11133167401421815,
"rewards/reward_accuracy/mean": 0.97890625,
"rewards/reward_accuracy/std": 0.1094370238482952,
"rewards/reward_format/mean": 0.09970703125,
"rewards/reward_format/std": 0.0034037382109090688,
"sampling/importance_sampling_ratio/max": 2.4551737785339354,
"sampling/importance_sampling_ratio/mean": 0.9963717699050904,
"sampling/importance_sampling_ratio/min": 0.1130001574754715,
"sampling/sampling_logp_difference/max": 1.0132632851600647,
"sampling/sampling_logp_difference/mean": 0.003932455112226308,
"step": 8640,
"step_time": 6.835694029417937
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1308.3,
"completions/max_terminated_length": 1251.3,
"completions/mean_length": 151.330078125,
"completions/mean_terminated_length": 144.69277648925782,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.04259004567284137,
"epoch": 18.522483940042825,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 9.135100000000002e-06,
"loss": -0.0008,
"num_tokens": 882785690.0,
"reward": 1.0791211128234863,
"reward_std": 0.09905615895986557,
"rewards/reward_accuracy/mean": 0.979296875,
"rewards/reward_accuracy/std": 0.09792580530047416,
"rewards/reward_format/mean": 0.0998242199420929,
"rewards/reward_format/std": 0.0015754709485918284,
"sampling/importance_sampling_ratio/max": 2.4045244216918946,
"sampling/importance_sampling_ratio/mean": 0.9886280119419097,
"sampling/importance_sampling_ratio/min": 0.09932979568839073,
"sampling/sampling_logp_difference/max": 0.9599446177482605,
"sampling/sampling_logp_difference/mean": 0.004387426911853254,
"step": 8650,
"step_time": 6.356723203699221
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.616223628137959e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.616223628137959e-06,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 1447.7,
"completions/max_terminated_length": 1292.3,
"completions/mean_length": 191.150390625,
"completions/mean_terminated_length": 162.03348541259766,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"entropy": 0.04893013313412666,
"epoch": 18.54389721627409,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.279296875,
"learning_rate": 9.134100000000001e-06,
"loss": -0.0035,
"num_tokens": 883791291.0,
"reward": 1.0540625154972076,
"reward_std": 0.15334973216522485,
"rewards/reward_accuracy/mean": 0.95546875,
"rewards/reward_accuracy/std": 0.14849773049354553,
"rewards/reward_format/mean": 0.09859375134110451,
"rewards/reward_format/std": 0.007381148962303996,
"sampling/importance_sampling_ratio/max": 2.5085996627807616,
"sampling/importance_sampling_ratio/mean": 0.9848408937454224,
"sampling/importance_sampling_ratio/min": 0.10884870886802674,
"sampling/sampling_logp_difference/max": 0.967182868719101,
"sampling/sampling_logp_difference/mean": 0.004076297814026475,
"step": 8660,
"step_time": 7.511807772595785
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1241.0,
"completions/max_terminated_length": 1126.8,
"completions/mean_length": 164.298046875,
"completions/mean_terminated_length": 156.26779022216797,
"completions/min_length": 65.2,
"completions/min_terminated_length": 65.2,
"entropy": 0.047662134491838516,
"epoch": 18.565310492505354,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.0,
"learning_rate": 9.1331e-06,
"loss": -0.0079,
"num_tokens": 884728774.0,
"reward": 1.0622070491313935,
"reward_std": 0.14775382950901986,
"rewards/reward_accuracy/mean": 0.9625,
"rewards/reward_accuracy/std": 0.14660028591752053,
"rewards/reward_format/mean": 0.09970703199505807,
"rewards/reward_format/std": 0.003252748865634203,
"sampling/importance_sampling_ratio/max": 2.658415675163269,
"sampling/importance_sampling_ratio/mean": 1.0017923414707184,
"sampling/importance_sampling_ratio/min": 0.21202876791357994,
"sampling/sampling_logp_difference/max": 1.003309726715088,
"sampling/sampling_logp_difference/mean": 0.004321845015510917,
"step": 8670,
"step_time": 6.112202731100842
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1905.3,
"completions/max_terminated_length": 1271.6,
"completions/mean_length": 182.49609375,
"completions/mean_terminated_length": 170.08214111328124,
"completions/min_length": 70.5,
"completions/min_terminated_length": 70.5,
"entropy": 0.049701267620548606,
"epoch": 18.58672376873662,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.166015625,
"learning_rate": 9.1321e-06,
"loss": -0.0042,
"num_tokens": 885722508.0,
"reward": 1.0522070407867432,
"reward_std": 0.18709155097603797,
"rewards/reward_accuracy/mean": 0.952734375,
"rewards/reward_accuracy/std": 0.18499492704868317,
"rewards/reward_format/mean": 0.0994726575911045,
"rewards/reward_format/std": 0.004201127146370709,
"sampling/importance_sampling_ratio/max": 2.3362228512763976,
"sampling/importance_sampling_ratio/mean": 0.9857252776622772,
"sampling/importance_sampling_ratio/min": 0.06558009525761008,
"sampling/sampling_logp_difference/max": 1.280612337589264,
"sampling/sampling_logp_difference/mean": 0.004220749577507376,
"step": 8680,
"step_time": 9.024743852496613
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1386.5,
"completions/max_terminated_length": 1111.1,
"completions/mean_length": 154.387109375,
"completions/mean_terminated_length": 149.97672424316406,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.04180880025960505,
"epoch": 18.60813704496788,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.3046875,
"learning_rate": 9.1311e-06,
"loss": -0.0067,
"num_tokens": 886633691.0,
"reward": 1.069238293170929,
"reward_std": 0.1423884943127632,
"rewards/reward_accuracy/mean": 0.96953125,
"rewards/reward_accuracy/std": 0.14058632850646974,
"rewards/reward_format/mean": 0.09970703125,
"rewards/reward_format/std": 0.003890778520144522,
"sampling/importance_sampling_ratio/max": 2.498514175415039,
"sampling/importance_sampling_ratio/mean": 0.9778927564620972,
"sampling/importance_sampling_ratio/min": 0.03938644677400589,
"sampling/sampling_logp_difference/max": 1.2177836418151855,
"sampling/sampling_logp_difference/mean": 0.003969055390916765,
"step": 8690,
"step_time": 6.631099032890051
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1089.1,
"completions/max_terminated_length": 781.8,
"completions/mean_length": 149.696875,
"completions/mean_terminated_length": 144.5385284423828,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.041011302988044916,
"epoch": 18.629550321199144,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 9.130100000000001e-06,
"loss": -0.0018,
"num_tokens": 887526515.0,
"reward": 1.082187533378601,
"reward_std": 0.09522264078259468,
"rewards/reward_accuracy/mean": 0.982421875,
"rewards/reward_accuracy/std": 0.0937635876238346,
"rewards/reward_format/mean": 0.09976562708616257,
"rewards/reward_format/std": 0.0025140494108200073,
"sampling/importance_sampling_ratio/max": 2.4721116065979003,
"sampling/importance_sampling_ratio/mean": 0.9914973497390747,
"sampling/importance_sampling_ratio/min": 0.17050465643405915,
"sampling/sampling_logp_difference/max": 0.9500296950340271,
"sampling/sampling_logp_difference/mean": 0.003960172017104924,
"step": 8700,
"step_time": 5.4406852170068305
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1336.0,
"completions/max_terminated_length": 1038.5,
"completions/mean_length": 163.541015625,
"completions/mean_terminated_length": 153.95977630615235,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.04287818595767021,
"epoch": 18.650963597430408,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.0869140625,
"learning_rate": 9.1291e-06,
"loss": -0.0073,
"num_tokens": 888466380.0,
"reward": 1.072226595878601,
"reward_std": 0.1356072448194027,
"rewards/reward_accuracy/mean": 0.97265625,
"rewards/reward_accuracy/std": 0.1331235311925411,
"rewards/reward_format/mean": 0.09957031458616257,
"rewards/reward_format/std": 0.003905145265161991,
"sampling/importance_sampling_ratio/max": 2.2513145208358765,
"sampling/importance_sampling_ratio/mean": 0.9915796041488647,
"sampling/importance_sampling_ratio/min": 0.09864196181297302,
"sampling/sampling_logp_difference/max": 0.9241582751274109,
"sampling/sampling_logp_difference/mean": 0.003949113050475716,
"step": 8710,
"step_time": 6.516004089493071
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1404.9,
"completions/max_terminated_length": 858.1,
"completions/mean_length": 160.350390625,
"completions/mean_terminated_length": 152.96230392456056,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.04089411471504718,
"epoch": 18.67237687366167,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.1474609375,
"learning_rate": 9.128100000000002e-06,
"loss": -0.0057,
"num_tokens": 889395325.0,
"reward": 1.0716211080551148,
"reward_std": 0.13884064704179763,
"rewards/reward_accuracy/mean": 0.971875,
"rewards/reward_accuracy/std": 0.13653998747467994,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.0027140011778101327,
"sampling/importance_sampling_ratio/max": 2.4920124769210816,
"sampling/importance_sampling_ratio/mean": 0.9905592918395996,
"sampling/importance_sampling_ratio/min": 0.12522636279463767,
"sampling/sampling_logp_difference/max": 1.0339375972747802,
"sampling/sampling_logp_difference/mean": 0.003972335834987462,
"step": 8720,
"step_time": 6.7700647299090635
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1201.0,
"completions/max_terminated_length": 904.0,
"completions/mean_length": 153.256640625,
"completions/mean_terminated_length": 142.25006103515625,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.037436686805449426,
"epoch": 18.693790149892934,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.34375,
"learning_rate": 9.127100000000001e-06,
"loss": -0.0034,
"num_tokens": 890300302.0,
"reward": 1.0658398747444153,
"reward_std": 0.13231036067008972,
"rewards/reward_accuracy/mean": 0.96640625,
"rewards/reward_accuracy/std": 0.1302319161593914,
"rewards/reward_format/mean": 0.09943359568715096,
"rewards/reward_format/std": 0.0042722588405013084,
"sampling/importance_sampling_ratio/max": 2.4907397270202636,
"sampling/importance_sampling_ratio/mean": 0.9921734571456909,
"sampling/importance_sampling_ratio/min": 0.08761086165905,
"sampling/sampling_logp_difference/max": 1.0846805572509766,
"sampling/sampling_logp_difference/mean": 0.0037072953302413223,
"step": 8730,
"step_time": 5.978781973102014
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1502.7,
"completions/max_terminated_length": 1153.8,
"completions/mean_length": 166.975390625,
"completions/mean_terminated_length": 155.34710998535155,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.04686242416501045,
"epoch": 18.715203426124198,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.24609375,
"learning_rate": 9.1261e-06,
"loss": -0.011,
"num_tokens": 891249919.0,
"reward": 1.0600195527076721,
"reward_std": 0.16591929867863656,
"rewards/reward_accuracy/mean": 0.960546875,
"rewards/reward_accuracy/std": 0.1641511343419552,
"rewards/reward_format/mean": 0.0994726575911045,
"rewards/reward_format/std": 0.004328975477255881,
"sampling/importance_sampling_ratio/max": 2.3338439106941222,
"sampling/importance_sampling_ratio/mean": 0.979765784740448,
"sampling/importance_sampling_ratio/min": 0.11135517656803132,
"sampling/sampling_logp_difference/max": 0.9557677745819092,
"sampling/sampling_logp_difference/mean": 0.00426657609641552,
"step": 8740,
"step_time": 7.26250603471126
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1391.7,
"completions/max_terminated_length": 1232.3,
"completions/mean_length": 172.420703125,
"completions/mean_terminated_length": 164.51128540039062,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.04698663067538291,
"epoch": 18.73661670235546,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.0,
"learning_rate": 9.125100000000002e-06,
"loss": -0.0068,
"num_tokens": 892210868.0,
"reward": 1.0531836092472076,
"reward_std": 0.17547309920191764,
"rewards/reward_accuracy/mean": 0.953515625,
"rewards/reward_accuracy/std": 0.17423024028539658,
"rewards/reward_format/mean": 0.09966797009110451,
"rewards/reward_format/std": 0.0032918840181082485,
"sampling/importance_sampling_ratio/max": 2.4605786085128782,
"sampling/importance_sampling_ratio/mean": 0.9814718842506409,
"sampling/importance_sampling_ratio/min": 0.1358148753643036,
"sampling/sampling_logp_difference/max": 1.0722109794616699,
"sampling/sampling_logp_difference/mean": 0.004365383996628225,
"step": 8750,
"step_time": 6.699193251872202
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1345.6,
"completions/max_terminated_length": 1001.2,
"completions/mean_length": 152.348828125,
"completions/mean_terminated_length": 143.48479232788085,
"completions/min_length": 61.9,
"completions/min_terminated_length": 61.9,
"entropy": 0.03991281243506819,
"epoch": 18.758029978586723,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.443359375,
"learning_rate": 9.124100000000001e-06,
"loss": -0.0041,
"num_tokens": 893114817.0,
"reward": 1.067929708957672,
"reward_std": 0.13865133598446847,
"rewards/reward_accuracy/mean": 0.968359375,
"rewards/reward_accuracy/std": 0.13666071742773056,
"rewards/reward_format/mean": 0.09957031384110451,
"rewards/reward_format/std": 0.0044530523009598255,
"sampling/importance_sampling_ratio/max": 2.44599848985672,
"sampling/importance_sampling_ratio/mean": 0.9875916957855224,
"sampling/importance_sampling_ratio/min": 0.15441621616482734,
"sampling/sampling_logp_difference/max": 0.9445678651332855,
"sampling/sampling_logp_difference/mean": 0.004008785868063569,
"step": 8760,
"step_time": 6.596600792300888
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1613.5,
"completions/max_terminated_length": 1448.0,
"completions/mean_length": 153.862890625,
"completions/mean_terminated_length": 145.6830581665039,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.04200834957882762,
"epoch": 18.779443254817988,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.1171875,
"learning_rate": 9.1231e-06,
"loss": -0.011,
"num_tokens": 894024226.0,
"reward": 1.0776953220367431,
"reward_std": 0.13383573219180106,
"rewards/reward_accuracy/mean": 0.978125,
"rewards/reward_accuracy/std": 0.1315659649670124,
"rewards/reward_format/mean": 0.09957031309604644,
"rewards/reward_format/std": 0.003573947888799012,
"sampling/importance_sampling_ratio/max": 2.53936288356781,
"sampling/importance_sampling_ratio/mean": 0.9882951974868774,
"sampling/importance_sampling_ratio/min": 0.13987094312906265,
"sampling/sampling_logp_difference/max": 1.1786380052566527,
"sampling/sampling_logp_difference/mean": 0.004030270059593022,
"step": 8770,
"step_time": 7.722741360784857
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 845.8,
"completions/max_terminated_length": 823.0,
"completions/mean_length": 159.998828125,
"completions/mean_terminated_length": 154.19696044921875,
"completions/min_length": 67.9,
"completions/min_terminated_length": 67.9,
"entropy": 0.04234646097756922,
"epoch": 18.800856531049252,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.0,
"learning_rate": 9.1221e-06,
"loss": -0.0073,
"num_tokens": 894953487.0,
"reward": 1.0739257991313935,
"reward_std": 0.1045950286090374,
"rewards/reward_accuracy/mean": 0.97421875,
"rewards/reward_accuracy/std": 0.10336325019598007,
"rewards/reward_format/mean": 0.09970703274011612,
"rewards/reward_format/std": 0.002262084931135178,
"sampling/importance_sampling_ratio/max": 2.3516990184783935,
"sampling/importance_sampling_ratio/mean": 0.9816068172454834,
"sampling/importance_sampling_ratio/min": 0.20281865820288658,
"sampling/sampling_logp_difference/max": 0.9887495040893555,
"sampling/sampling_logp_difference/mean": 0.003976118261925876,
"step": 8780,
"step_time": 4.431175550018088
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1322.8,
"completions/max_terminated_length": 1127.5,
"completions/mean_length": 148.6921875,
"completions/mean_terminated_length": 147.20387268066406,
"completions/min_length": 65.3,
"completions/min_terminated_length": 65.3,
"entropy": 0.04277651521842927,
"epoch": 18.822269807280513,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.07373046875,
"learning_rate": 9.1211e-06,
"loss": -0.0043,
"num_tokens": 895851339.0,
"reward": 1.0835156321525574,
"reward_std": 0.1150617890059948,
"rewards/reward_accuracy/mean": 0.98359375,
"rewards/reward_accuracy/std": 0.11450174674391747,
"rewards/reward_format/mean": 0.09992187544703483,
"rewards/reward_format/std": 0.0012500000651925803,
"sampling/importance_sampling_ratio/max": 2.2957559704780577,
"sampling/importance_sampling_ratio/mean": 0.9893794894218445,
"sampling/importance_sampling_ratio/min": 0.19688963927328587,
"sampling/sampling_logp_difference/max": 0.9163195013999939,
"sampling/sampling_logp_difference/mean": 0.003939542546868324,
"step": 8790,
"step_time": 6.262025274184998
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1522.3,
"completions/max_terminated_length": 1436.3,
"completions/mean_length": 173.088671875,
"completions/mean_terminated_length": 165.05245819091797,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.047683061962015924,
"epoch": 18.843683083511777,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.318359375,
"learning_rate": 9.120100000000001e-06,
"loss": -0.009,
"num_tokens": 896814430.0,
"reward": 1.0507812559604646,
"reward_std": 0.1847189910709858,
"rewards/reward_accuracy/mean": 0.951171875,
"rewards/reward_accuracy/std": 0.18295823112130166,
"rewards/reward_format/mean": 0.09960937574505806,
"rewards/reward_format/std": 0.003899338305927813,
"sampling/importance_sampling_ratio/max": 2.4815653443336485,
"sampling/importance_sampling_ratio/mean": 0.97511927485466,
"sampling/importance_sampling_ratio/min": 0.0693464394658804,
"sampling/sampling_logp_difference/max": 0.9532556533813477,
"sampling/sampling_logp_difference/mean": 0.004153065057471395,
"step": 8800,
"step_time": 7.608273927081609
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1444.7,
"completions/max_terminated_length": 1170.7,
"completions/mean_length": 169.35234375,
"completions/mean_terminated_length": 160.7246971130371,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.044793715537525716,
"epoch": 18.865096359743042,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.212890625,
"learning_rate": 9.1191e-06,
"loss": -0.0031,
"num_tokens": 897766692.0,
"reward": 1.0628711223602294,
"reward_std": 0.1508186012506485,
"rewards/reward_accuracy/mean": 0.96328125,
"rewards/reward_accuracy/std": 0.14852382242679596,
"rewards/reward_format/mean": 0.09958984553813935,
"rewards/reward_format/std": 0.003871976584196091,
"sampling/importance_sampling_ratio/max": 2.5512237310409547,
"sampling/importance_sampling_ratio/mean": 0.9923527061939239,
"sampling/importance_sampling_ratio/min": 0.1581953912973404,
"sampling/sampling_logp_difference/max": 0.9111201524734497,
"sampling/sampling_logp_difference/mean": 0.003959611430764199,
"step": 8810,
"step_time": 6.780620105980779
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1192.0,
"completions/max_terminated_length": 1017.9,
"completions/mean_length": 143.73515625,
"completions/mean_terminated_length": 142.2555725097656,
"completions/min_length": 63.5,
"completions/min_terminated_length": 63.5,
"entropy": 0.038904798892326654,
"epoch": 18.886509635974303,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.453125,
"learning_rate": 9.1181e-06,
"loss": -0.0033,
"num_tokens": 898657742.0,
"reward": 1.0636132955551147,
"reward_std": 0.15745854601264,
"rewards/reward_accuracy/mean": 0.963671875,
"rewards/reward_accuracy/std": 0.15713395848870276,
"rewards/reward_format/mean": 0.09994140714406967,
"rewards/reward_format/std": 0.0009375000605359674,
"sampling/importance_sampling_ratio/max": 2.4830235481262206,
"sampling/importance_sampling_ratio/mean": 1.0011702358722687,
"sampling/importance_sampling_ratio/min": 0.21615881137549878,
"sampling/sampling_logp_difference/max": 0.7998057126998901,
"sampling/sampling_logp_difference/mean": 0.0036559398286044598,
"step": 8820,
"step_time": 5.7111719324049774
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015234375,
"completions/max_length": 1566.9,
"completions/max_terminated_length": 1319.3,
"completions/mean_length": 195.86171875,
"completions/mean_terminated_length": 167.4388214111328,
"completions/min_length": 68.1,
"completions/min_terminated_length": 68.1,
"entropy": 0.05504367693793029,
"epoch": 18.907922912205567,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.2138671875,
"learning_rate": 9.117100000000001e-06,
"loss": -0.0024,
"num_tokens": 899680908.0,
"reward": 1.0232617437839509,
"reward_std": 0.2627103254199028,
"rewards/reward_accuracy/mean": 0.924609375,
"rewards/reward_accuracy/std": 0.25843053460121157,
"rewards/reward_format/mean": 0.09865234494209289,
"rewards/reward_format/std": 0.007323176995851099,
"sampling/importance_sampling_ratio/max": 2.6613732099533083,
"sampling/importance_sampling_ratio/mean": 0.9844253420829773,
"sampling/importance_sampling_ratio/min": 0.07841789871454238,
"sampling/sampling_logp_difference/max": 1.175289273262024,
"sampling/sampling_logp_difference/mean": 0.004265462956391275,
"step": 8830,
"step_time": 7.830403436993947
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1432.1,
"completions/max_terminated_length": 1363.2,
"completions/mean_length": 181.621484375,
"completions/mean_terminated_length": 171.73119659423827,
"completions/min_length": 69.5,
"completions/min_terminated_length": 69.5,
"entropy": 0.04945667127612978,
"epoch": 18.92933618843683,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.55078125,
"learning_rate": 9.1161e-06,
"loss": -0.0077,
"num_tokens": 900667155.0,
"reward": 1.0533984541893004,
"reward_std": 0.1786373123526573,
"rewards/reward_accuracy/mean": 0.95390625,
"rewards/reward_accuracy/std": 0.1771399885416031,
"rewards/reward_format/mean": 0.09949218779802323,
"rewards/reward_format/std": 0.0031739657977595927,
"sampling/importance_sampling_ratio/max": 2.446089482307434,
"sampling/importance_sampling_ratio/mean": 0.970781409740448,
"sampling/importance_sampling_ratio/min": 0.10176858138293028,
"sampling/sampling_logp_difference/max": 1.2614002227783203,
"sampling/sampling_logp_difference/mean": 0.004176443256437778,
"step": 8840,
"step_time": 7.052500664503896
},
{
"clip_ratio/high_max": 1.6164788394235075e-05,
"clip_ratio/high_mean": 2.0205985492793844e-06,
"clip_ratio/low_mean": 1.134206286224071e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.15480479002872e-06,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1728.7,
"completions/max_terminated_length": 1295.6,
"completions/mean_length": 174.925390625,
"completions/mean_terminated_length": 160.90143432617188,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.04822886758483946,
"epoch": 18.950749464668093,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.408203125,
"learning_rate": 9.115100000000002e-06,
"loss": -0.0028,
"num_tokens": 901631140.0,
"reward": 1.0497461318969727,
"reward_std": 0.19387315437197686,
"rewards/reward_accuracy/mean": 0.950390625,
"rewards/reward_accuracy/std": 0.1914452336728573,
"rewards/reward_format/mean": 0.09935547113418579,
"rewards/reward_format/std": 0.00598320048302412,
"sampling/importance_sampling_ratio/max": 2.336688530445099,
"sampling/importance_sampling_ratio/mean": 0.97986119389534,
"sampling/importance_sampling_ratio/min": 0.11514662876725197,
"sampling/sampling_logp_difference/max": 0.9252523362636567,
"sampling/sampling_logp_difference/mean": 0.004131598072126508,
"step": 8850,
"step_time": 8.216890418782715
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1513.0,
"completions/max_terminated_length": 1269.2,
"completions/mean_length": 164.562109375,
"completions/mean_terminated_length": 151.3040344238281,
"completions/min_length": 60.2,
"completions/min_terminated_length": 60.2,
"entropy": 0.04521771401632577,
"epoch": 18.972162740899357,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.13671875,
"learning_rate": 9.114100000000001e-06,
"loss": -0.0068,
"num_tokens": 902573331.0,
"reward": 1.0624414145946504,
"reward_std": 0.1601423889398575,
"rewards/reward_accuracy/mean": 0.962890625,
"rewards/reward_accuracy/std": 0.15832012221217157,
"rewards/reward_format/mean": 0.0995507813990116,
"rewards/reward_format/std": 0.004036956024356187,
"sampling/importance_sampling_ratio/max": 2.2748740792274473,
"sampling/importance_sampling_ratio/mean": 0.9888275146484375,
"sampling/importance_sampling_ratio/min": 0.1455095828510821,
"sampling/sampling_logp_difference/max": 0.8934823095798492,
"sampling/sampling_logp_difference/mean": 0.004105035145767033,
"step": 8860,
"step_time": 7.474874223925871
},
{
"clip_ratio/high_max": 3.940731403417885e-06,
"clip_ratio/high_mean": 4.925914254272357e-07,
"clip_ratio/low_mean": 2.012497679970693e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.5050891053979286e-06,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1573.5,
"completions/max_terminated_length": 1439.5,
"completions/mean_length": 193.993359375,
"completions/mean_terminated_length": 173.92760620117187,
"completions/min_length": 69.6,
"completions/min_terminated_length": 69.6,
"entropy": 0.056690949876792726,
"epoch": 18.99357601713062,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.2412109375,
"learning_rate": 9.113100000000001e-06,
"loss": -0.01,
"num_tokens": 903584466.0,
"reward": 1.0438672304153442,
"reward_std": 0.19322730749845504,
"rewards/reward_accuracy/mean": 0.94453125,
"rewards/reward_accuracy/std": 0.19092829525470734,
"rewards/reward_format/mean": 0.09933593943715095,
"rewards/reward_format/std": 0.005261460202746093,
"sampling/importance_sampling_ratio/max": 2.6452703714370727,
"sampling/importance_sampling_ratio/mean": 0.9871454477310181,
"sampling/importance_sampling_ratio/min": 0.14121552258729936,
"sampling/sampling_logp_difference/max": 0.9183063268661499,
"sampling/sampling_logp_difference/mean": 0.00452033847104758,
"step": 8870,
"step_time": 7.528314584371401
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1636.2,
"completions/max_terminated_length": 1289.9,
"completions/mean_length": 173.97578125,
"completions/mean_terminated_length": 160.81491241455078,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.052287173364311455,
"epoch": 19.014989293361886,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.392578125,
"learning_rate": 9.1121e-06,
"loss": -0.0087,
"num_tokens": 904546436.0,
"reward": 1.0679101943969727,
"reward_std": 0.15796584635972977,
"rewards/reward_accuracy/mean": 0.968359375,
"rewards/reward_accuracy/std": 0.15526243522763253,
"rewards/reward_format/mean": 0.09955078288912773,
"rewards/reward_format/std": 0.005026802234351635,
"sampling/importance_sampling_ratio/max": 2.4295794129371644,
"sampling/importance_sampling_ratio/mean": 0.9867786645889283,
"sampling/importance_sampling_ratio/min": 0.13332206904888153,
"sampling/sampling_logp_difference/max": 1.0020817577838899,
"sampling/sampling_logp_difference/mean": 0.004271209938451648,
"step": 8880,
"step_time": 7.930833600505139
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1243.9,
"completions/max_terminated_length": 1112.6,
"completions/mean_length": 166.021875,
"completions/mean_terminated_length": 156.50658416748047,
"completions/min_length": 67.8,
"completions/min_terminated_length": 67.8,
"entropy": 0.04780408081132918,
"epoch": 19.036402569593147,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.39453125,
"learning_rate": 9.1111e-06,
"loss": -0.0062,
"num_tokens": 905492940.0,
"reward": 1.0366797149181366,
"reward_std": 0.18530816361308097,
"rewards/reward_accuracy/mean": 0.937109375,
"rewards/reward_accuracy/std": 0.18424833044409752,
"rewards/reward_format/mean": 0.09957031458616257,
"rewards/reward_format/std": 0.0034375346498563887,
"sampling/importance_sampling_ratio/max": 2.7050370454788206,
"sampling/importance_sampling_ratio/mean": 0.9874306678771972,
"sampling/importance_sampling_ratio/min": 0.045328122656792404,
"sampling/sampling_logp_difference/max": 0.8893057107925415,
"sampling/sampling_logp_difference/mean": 0.0044152555521577595,
"step": 8890,
"step_time": 6.074370008212282
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1075.6,
"completions/max_terminated_length": 1017.8,
"completions/mean_length": 163.89296875,
"completions/mean_terminated_length": 153.77596130371094,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.041960479505360124,
"epoch": 19.05781584582441,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.484375,
"learning_rate": 9.110100000000001e-06,
"loss": -0.0007,
"num_tokens": 906430954.0,
"reward": 1.0490820586681366,
"reward_std": 0.18053021058440208,
"rewards/reward_accuracy/mean": 0.949609375,
"rewards/reward_accuracy/std": 0.17856702581048012,
"rewards/reward_format/mean": 0.0994726575911045,
"rewards/reward_format/std": 0.003806931711733341,
"sampling/importance_sampling_ratio/max": 2.4334341526031493,
"sampling/importance_sampling_ratio/mean": 0.9943706631660462,
"sampling/importance_sampling_ratio/min": 0.16125569641590118,
"sampling/sampling_logp_difference/max": 0.8449162840843201,
"sampling/sampling_logp_difference/mean": 0.004114087275229395,
"step": 8900,
"step_time": 5.452935524901841
},
{
"clip_ratio/high_max": 2.854532976925839e-06,
"clip_ratio/high_mean": 3.5681662211572986e-07,
"clip_ratio/low_mean": 1.9633879674074705e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.3202045895232002e-06,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1481.4,
"completions/max_terminated_length": 1237.7,
"completions/mean_length": 167.775,
"completions/mean_terminated_length": 149.3366683959961,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"entropy": 0.03912908544298262,
"epoch": 19.079229122055676,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.2197265625,
"learning_rate": 9.1091e-06,
"loss": -0.0033,
"num_tokens": 907373690.0,
"reward": 1.0491015791893006,
"reward_std": 0.1719110243022442,
"rewards/reward_accuracy/mean": 0.95,
"rewards/reward_accuracy/std": 0.1683637149631977,
"rewards/reward_format/mean": 0.09910156279802322,
"rewards/reward_format/std": 0.005975830112583935,
"sampling/importance_sampling_ratio/max": 2.377292287349701,
"sampling/importance_sampling_ratio/mean": 0.9857052564620972,
"sampling/importance_sampling_ratio/min": 0.1615949898958206,
"sampling/sampling_logp_difference/max": 0.8699005603790283,
"sampling/sampling_logp_difference/mean": 0.003680521622300148,
"step": 8910,
"step_time": 7.259433790607727
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1355.7,
"completions/max_terminated_length": 1128.4,
"completions/mean_length": 150.56953125,
"completions/mean_terminated_length": 148.3381576538086,
"completions/min_length": 66.5,
"completions/min_terminated_length": 66.5,
"entropy": 0.040584154822863636,
"epoch": 19.100642398286936,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.1435546875,
"learning_rate": 9.1081e-06,
"loss": -0.0019,
"num_tokens": 908273308.0,
"reward": 1.0846484541893004,
"reward_std": 0.09556948721874506,
"rewards/reward_accuracy/mean": 0.984765625,
"rewards/reward_accuracy/std": 0.09455022066831589,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.0015071486588567496,
"sampling/importance_sampling_ratio/max": 2.3009019255638123,
"sampling/importance_sampling_ratio/mean": 0.9887462496757508,
"sampling/importance_sampling_ratio/min": 0.11690510474145413,
"sampling/sampling_logp_difference/max": 0.9396689176559448,
"sampling/sampling_logp_difference/mean": 0.004002215317450463,
"step": 8920,
"step_time": 6.470840089800186
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 935.7,
"completions/max_terminated_length": 843.6,
"completions/mean_length": 152.892578125,
"completions/mean_terminated_length": 148.55570526123046,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.038009654148481786,
"epoch": 19.1220556745182,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.8515625,
"learning_rate": 9.107100000000001e-06,
"loss": 0.001,
"num_tokens": 909182937.0,
"reward": 1.0443164229393005,
"reward_std": 0.1876315087080002,
"rewards/reward_accuracy/mean": 0.94453125,
"rewards/reward_accuracy/std": 0.1866455964744091,
"rewards/reward_format/mean": 0.09978515729308128,
"rewards/reward_format/std": 0.0023706002160906793,
"sampling/importance_sampling_ratio/max": 2.680069637298584,
"sampling/importance_sampling_ratio/mean": 0.9896520793437957,
"sampling/importance_sampling_ratio/min": 0.18095069602131844,
"sampling/sampling_logp_difference/max": 1.0252466320991516,
"sampling/sampling_logp_difference/mean": 0.0038561235880479215,
"step": 8930,
"step_time": 4.845793478607083
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1280.5,
"completions/max_terminated_length": 854.3,
"completions/mean_length": 154.896875,
"completions/mean_terminated_length": 149.7188293457031,
"completions/min_length": 67.6,
"completions/min_terminated_length": 67.6,
"entropy": 0.038124445173889396,
"epoch": 19.143468950749465,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.34765625,
"learning_rate": 9.1061e-06,
"loss": -0.0032,
"num_tokens": 910102337.0,
"reward": 1.085703146457672,
"reward_std": 0.10287698060274124,
"rewards/reward_accuracy/mean": 0.9859375,
"rewards/reward_accuracy/std": 0.10126774236559868,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0025854269973933698,
"sampling/importance_sampling_ratio/max": 2.5273266077041625,
"sampling/importance_sampling_ratio/mean": 0.9905018150806427,
"sampling/importance_sampling_ratio/min": 0.08943483680486679,
"sampling/sampling_logp_difference/max": 0.9332442164421082,
"sampling/sampling_logp_difference/mean": 0.003796239849179983,
"step": 8940,
"step_time": 6.150222820113413
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 6.219105671334546e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 6.219105671334546e-07,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1487.4,
"completions/max_terminated_length": 1177.3,
"completions/mean_length": 178.9421875,
"completions/mean_terminated_length": 160.55400390625,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.04527610051445663,
"epoch": 19.16488222698073,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.0,
"learning_rate": 9.105100000000002e-06,
"loss": -0.005,
"num_tokens": 911076717.0,
"reward": 1.0412695407867432,
"reward_std": 0.1892039254307747,
"rewards/reward_accuracy/mean": 0.9421875,
"rewards/reward_accuracy/std": 0.1861333131790161,
"rewards/reward_format/mean": 0.09908203110098839,
"rewards/reward_format/std": 0.0052246110746636985,
"sampling/importance_sampling_ratio/max": 2.5064181327819823,
"sampling/importance_sampling_ratio/mean": 0.9853618681430817,
"sampling/importance_sampling_ratio/min": 0.09727071821689606,
"sampling/sampling_logp_difference/max": 0.9031975388526916,
"sampling/sampling_logp_difference/mean": 0.0039537092437967655,
"step": 8950,
"step_time": 7.371974029301782
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1550.9,
"completions/max_terminated_length": 1096.7,
"completions/mean_length": 179.44140625,
"completions/mean_terminated_length": 163.4389678955078,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.05023156348615885,
"epoch": 19.18629550321199,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.68359375,
"learning_rate": 9.104100000000001e-06,
"loss": -0.0129,
"num_tokens": 912059143.0,
"reward": 1.0215625166893005,
"reward_std": 0.2159823954105377,
"rewards/reward_accuracy/mean": 0.922265625,
"rewards/reward_accuracy/std": 0.21377946436405182,
"rewards/reward_format/mean": 0.09929687604308128,
"rewards/reward_format/std": 0.006066297856159508,
"sampling/importance_sampling_ratio/max": 2.50685875415802,
"sampling/importance_sampling_ratio/mean": 0.9871061384677887,
"sampling/importance_sampling_ratio/min": 0.10962343923747539,
"sampling/sampling_logp_difference/max": 0.8912870049476623,
"sampling/sampling_logp_difference/mean": 0.00427790314424783,
"step": 8960,
"step_time": 7.615973992503132
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1561.5,
"completions/max_terminated_length": 1316.7,
"completions/mean_length": 153.91875,
"completions/mean_terminated_length": 145.06923217773436,
"completions/min_length": 62.8,
"completions/min_terminated_length": 62.8,
"entropy": 0.043986070435494184,
"epoch": 19.207708779443255,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 9.103100000000001e-06,
"loss": -0.0033,
"num_tokens": 912973271.0,
"reward": 1.0560156464576722,
"reward_std": 0.16589410603046417,
"rewards/reward_accuracy/mean": 0.95625,
"rewards/reward_accuracy/std": 0.16449629440903663,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0027702924329787494,
"sampling/importance_sampling_ratio/max": 2.527033734321594,
"sampling/importance_sampling_ratio/mean": 0.9809755921363831,
"sampling/importance_sampling_ratio/min": 0.09634014954790474,
"sampling/sampling_logp_difference/max": 1.026539784669876,
"sampling/sampling_logp_difference/mean": 0.0042065625544637445,
"step": 8970,
"step_time": 7.393489702590159
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 917.8,
"completions/max_terminated_length": 858.4,
"completions/mean_length": 161.348046875,
"completions/mean_terminated_length": 150.44712677001954,
"completions/min_length": 67.4,
"completions/min_terminated_length": 67.4,
"entropy": 0.04141873684711754,
"epoch": 19.22912205567452,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0,
"learning_rate": 9.1021e-06,
"loss": -0.0043,
"num_tokens": 913905314.0,
"reward": 1.067480492591858,
"reward_std": 0.11459275484085082,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.11278990209102631,
"rewards/reward_format/mean": 0.09951172098517418,
"rewards/reward_format/std": 0.003581091109663248,
"sampling/importance_sampling_ratio/max": 2.5542323112487795,
"sampling/importance_sampling_ratio/mean": 0.9926739871501923,
"sampling/importance_sampling_ratio/min": 0.11059153750538826,
"sampling/sampling_logp_difference/max": 1.2100009679794312,
"sampling/sampling_logp_difference/mean": 0.003986446699127555,
"step": 8980,
"step_time": 5.012093775707763
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1403.1,
"completions/max_terminated_length": 1179.2,
"completions/mean_length": 171.927734375,
"completions/mean_terminated_length": 164.69374389648436,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.04114390758331865,
"epoch": 19.25053533190578,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.330078125,
"learning_rate": 9.1011e-06,
"loss": -0.0104,
"num_tokens": 914870073.0,
"reward": 1.0562890887260437,
"reward_std": 0.18315192610025405,
"rewards/reward_accuracy/mean": 0.956640625,
"rewards/reward_accuracy/std": 0.18117154091596605,
"rewards/reward_format/mean": 0.09964843913912773,
"rewards/reward_format/std": 0.003172542783431709,
"sampling/importance_sampling_ratio/max": 2.585428333282471,
"sampling/importance_sampling_ratio/mean": 0.9943221807479858,
"sampling/importance_sampling_ratio/min": 0.16024016961455345,
"sampling/sampling_logp_difference/max": 1.0366257786750794,
"sampling/sampling_logp_difference/mean": 0.003938715043477714,
"step": 8990,
"step_time": 6.732246951115667
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1524.0,
"completions/max_terminated_length": 1158.0,
"completions/mean_length": 165.077734375,
"completions/mean_terminated_length": 154.11977996826172,
"completions/min_length": 63.5,
"completions/min_terminated_length": 63.5,
"entropy": 0.044104625540785494,
"epoch": 19.271948608137045,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.322265625,
"learning_rate": 9.100100000000001e-06,
"loss": -0.0132,
"num_tokens": 915814992.0,
"reward": 1.0702343821525573,
"reward_std": 0.14357689693570136,
"rewards/reward_accuracy/mean": 0.970703125,
"rewards/reward_accuracy/std": 0.14132425263524057,
"rewards/reward_format/mean": 0.09953124970197677,
"rewards/reward_format/std": 0.004622029257006943,
"sampling/importance_sampling_ratio/max": 2.5735597133636476,
"sampling/importance_sampling_ratio/mean": 0.9960297048091888,
"sampling/importance_sampling_ratio/min": 0.1938415549695492,
"sampling/sampling_logp_difference/max": 0.9466841995716095,
"sampling/sampling_logp_difference/mean": 0.004130793712101876,
"step": 9000,
"step_time": 7.507013888386427
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1368.0,
"completions/max_terminated_length": 1277.4,
"completions/mean_length": 161.849609375,
"completions/mean_terminated_length": 153.80353698730468,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.04460274586454034,
"epoch": 19.29336188436831,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.255859375,
"learning_rate": 9.0991e-06,
"loss": -0.006,
"num_tokens": 916750303.0,
"reward": 1.0746484518051147,
"reward_std": 0.1390233352780342,
"rewards/reward_accuracy/mean": 0.975,
"rewards/reward_accuracy/std": 0.1372666083276272,
"rewards/reward_format/mean": 0.09964843839406967,
"rewards/reward_format/std": 0.0031594250351190565,
"sampling/importance_sampling_ratio/max": 2.3888298511505126,
"sampling/importance_sampling_ratio/mean": 0.9826911926269531,
"sampling/importance_sampling_ratio/min": 0.09854875365272164,
"sampling/sampling_logp_difference/max": 0.8942802786827088,
"sampling/sampling_logp_difference/mean": 0.004037417168729007,
"step": 9010,
"step_time": 6.626548458894831
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1259.2,
"completions/max_terminated_length": 982.3,
"completions/mean_length": 160.118359375,
"completions/mean_terminated_length": 154.20431213378907,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.039300378412008286,
"epoch": 19.31477516059957,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.2021484375,
"learning_rate": 9.0981e-06,
"loss": -0.0065,
"num_tokens": 917680526.0,
"reward": 1.0810156345367432,
"reward_std": 0.10862610265612602,
"rewards/reward_accuracy/mean": 0.98125,
"rewards/reward_accuracy/std": 0.10742983967065811,
"rewards/reward_format/mean": 0.09976562559604644,
"rewards/reward_format/std": 0.0025854268576949837,
"sampling/importance_sampling_ratio/max": 2.4304882287979126,
"sampling/importance_sampling_ratio/mean": 0.9842626571655273,
"sampling/importance_sampling_ratio/min": 0.1485433302819729,
"sampling/sampling_logp_difference/max": 0.9653706073760986,
"sampling/sampling_logp_difference/mean": 0.0037817393662407995,
"step": 9020,
"step_time": 6.09609685667674
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1303.7,
"completions/max_terminated_length": 1121.0,
"completions/mean_length": 167.45859375,
"completions/mean_terminated_length": 158.265283203125,
"completions/min_length": 66.4,
"completions/min_terminated_length": 66.4,
"entropy": 0.046081725717522205,
"epoch": 19.336188436830835,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.0,
"learning_rate": 9.097100000000001e-06,
"loss": -0.0053,
"num_tokens": 918627076.0,
"reward": 1.048203134536743,
"reward_std": 0.17319639325141906,
"rewards/reward_accuracy/mean": 0.948828125,
"rewards/reward_accuracy/std": 0.1708996832370758,
"rewards/reward_format/mean": 0.09937500059604645,
"rewards/reward_format/std": 0.005020407401025296,
"sampling/importance_sampling_ratio/max": 2.313520622253418,
"sampling/importance_sampling_ratio/mean": 0.9787529170513153,
"sampling/importance_sampling_ratio/min": 0.17576206475496292,
"sampling/sampling_logp_difference/max": 0.9151412129402161,
"sampling/sampling_logp_difference/mean": 0.003927671303972602,
"step": 9030,
"step_time": 6.544187750690616
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1550.3,
"completions/max_terminated_length": 1347.8,
"completions/mean_length": 175.021484375,
"completions/mean_terminated_length": 161.96079711914064,
"completions/min_length": 68.3,
"completions/min_terminated_length": 68.3,
"entropy": 0.04554574289359152,
"epoch": 19.3576017130621,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.08837890625,
"learning_rate": 9.096100000000001e-06,
"loss": -0.0028,
"num_tokens": 919597851.0,
"reward": 1.0560937643051147,
"reward_std": 0.17668451368808746,
"rewards/reward_accuracy/mean": 0.956640625,
"rewards/reward_accuracy/std": 0.1745455116033554,
"rewards/reward_format/mean": 0.09945312589406967,
"rewards/reward_format/std": 0.00429825212340802,
"sampling/importance_sampling_ratio/max": 2.5012707471847535,
"sampling/importance_sampling_ratio/mean": 0.9883077681064606,
"sampling/importance_sampling_ratio/min": 0.10551765151321887,
"sampling/sampling_logp_difference/max": 0.9143837809562683,
"sampling/sampling_logp_difference/mean": 0.004029789008200169,
"step": 9040,
"step_time": 7.455769571097335
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1262.5,
"completions/max_terminated_length": 1157.7,
"completions/mean_length": 162.56328125,
"completions/mean_terminated_length": 153.1019500732422,
"completions/min_length": 65.2,
"completions/min_terminated_length": 65.2,
"entropy": 0.04198769889771938,
"epoch": 19.379014989293363,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.462890625,
"learning_rate": 9.0951e-06,
"loss": -0.0028,
"num_tokens": 920533901.0,
"reward": 1.0808007955551147,
"reward_std": 0.10556618794798851,
"rewards/reward_accuracy/mean": 0.98125,
"rewards/reward_accuracy/std": 0.10335618853569031,
"rewards/reward_format/mean": 0.09955078214406968,
"rewards/reward_format/std": 0.004045002884231508,
"sampling/importance_sampling_ratio/max": 2.3895641922950746,
"sampling/importance_sampling_ratio/mean": 0.9868336141109466,
"sampling/importance_sampling_ratio/min": 0.14454817920923232,
"sampling/sampling_logp_difference/max": 0.8851216435432434,
"sampling/sampling_logp_difference/mean": 0.004023644188418984,
"step": 9050,
"step_time": 6.260596655213158
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.0607175909171928e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.0607175909171928e-06,
"completions/clipped_ratio": 0.012890625,
"completions/max_length": 1555.7,
"completions/max_terminated_length": 1362.5,
"completions/mean_length": 187.04921875,
"completions/mean_terminated_length": 163.13358154296876,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.05630589392967522,
"epoch": 19.400428265524624,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.0,
"learning_rate": 9.094100000000002e-06,
"loss": -0.0009,
"num_tokens": 921530475.0,
"reward": 1.0347656548023223,
"reward_std": 0.21476473808288574,
"rewards/reward_accuracy/mean": 0.935546875,
"rewards/reward_accuracy/std": 0.21202049553394317,
"rewards/reward_format/mean": 0.09921875149011612,
"rewards/reward_format/std": 0.005950827174820006,
"sampling/importance_sampling_ratio/max": 2.6018747806549074,
"sampling/importance_sampling_ratio/mean": 0.9846381902694702,
"sampling/importance_sampling_ratio/min": 0.034876085445284845,
"sampling/sampling_logp_difference/max": 1.1526156902313232,
"sampling/sampling_logp_difference/mean": 0.004556133062578738,
"step": 9060,
"step_time": 8.017604624896194
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1479.1,
"completions/max_terminated_length": 1273.7,
"completions/mean_length": 164.63359375,
"completions/mean_terminated_length": 152.13829040527344,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.04406016489956528,
"epoch": 19.42184154175589,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.46484375,
"learning_rate": 9.093100000000001e-06,
"loss": -0.0026,
"num_tokens": 922468817.0,
"reward": 1.072363293170929,
"reward_std": 0.1253970354795456,
"rewards/reward_accuracy/mean": 0.973046875,
"rewards/reward_accuracy/std": 0.12188762649893761,
"rewards/reward_format/mean": 0.09931640699505806,
"rewards/reward_format/std": 0.005931702582165599,
"sampling/importance_sampling_ratio/max": 2.3584154844284058,
"sampling/importance_sampling_ratio/mean": 0.9878209054470062,
"sampling/importance_sampling_ratio/min": 0.0951646775007248,
"sampling/sampling_logp_difference/max": 1.2138105750083923,
"sampling/sampling_logp_difference/mean": 0.004100367845967412,
"step": 9070,
"step_time": 7.17604964140628
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 987.1,
"completions/max_terminated_length": 808.8,
"completions/mean_length": 138.9296875,
"completions/mean_terminated_length": 138.17735061645507,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"entropy": 0.03259525031317025,
"epoch": 19.443254817987153,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.10595703125,
"learning_rate": 9.0921e-06,
"loss": -0.0003,
"num_tokens": 923338445.0,
"reward": 1.0878515839576721,
"reward_std": 0.08517486974596977,
"rewards/reward_accuracy/mean": 0.987890625,
"rewards/reward_accuracy/std": 0.0845498725771904,
"rewards/reward_format/mean": 0.0999609388411045,
"rewards/reward_format/std": 0.0006250000558793544,
"sampling/importance_sampling_ratio/max": 2.2434217810630797,
"sampling/importance_sampling_ratio/mean": 0.9890681982040406,
"sampling/importance_sampling_ratio/min": 0.0942460473626852,
"sampling/sampling_logp_difference/max": 0.9122747778892517,
"sampling/sampling_logp_difference/mean": 0.0033510549226775767,
"step": 9080,
"step_time": 4.97146678819845
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.324529168618028e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.324529168618028e-06,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1302.3,
"completions/max_terminated_length": 1179.8,
"completions/mean_length": 163.815234375,
"completions/mean_terminated_length": 152.14934844970702,
"completions/min_length": 61.6,
"completions/min_terminated_length": 61.6,
"entropy": 0.04507605247199535,
"epoch": 19.464668094218414,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.2197265625,
"learning_rate": 9.0911e-06,
"loss": -0.0077,
"num_tokens": 924273508.0,
"reward": 1.0345898628234864,
"reward_std": 0.20652173459529877,
"rewards/reward_accuracy/mean": 0.93515625,
"rewards/reward_accuracy/std": 0.20440104454755784,
"rewards/reward_format/mean": 0.09943359494209289,
"rewards/reward_format/std": 0.004717904236167669,
"sampling/importance_sampling_ratio/max": 2.3643917083740233,
"sampling/importance_sampling_ratio/mean": 0.9827301621437072,
"sampling/importance_sampling_ratio/min": 0.09913333132863045,
"sampling/sampling_logp_difference/max": 0.9764537930488586,
"sampling/sampling_logp_difference/mean": 0.0042185493977740405,
"step": 9090,
"step_time": 6.245351968507748
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1310.6,
"completions/max_terminated_length": 1063.8,
"completions/mean_length": 161.569140625,
"completions/mean_terminated_length": 151.28403015136718,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"entropy": 0.0436047408496961,
"epoch": 19.48608137044968,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.69140625,
"learning_rate": 9.090100000000001e-06,
"loss": -0.0001,
"num_tokens": 925202645.0,
"reward": 1.0635937571525573,
"reward_std": 0.1378342740237713,
"rewards/reward_accuracy/mean": 0.9640625,
"rewards/reward_accuracy/std": 0.13611601218581199,
"rewards/reward_format/mean": 0.0995312511920929,
"rewards/reward_format/std": 0.004076853720471263,
"sampling/importance_sampling_ratio/max": 2.5059841156005858,
"sampling/importance_sampling_ratio/mean": 0.992784321308136,
"sampling/importance_sampling_ratio/min": 0.12614892572164535,
"sampling/sampling_logp_difference/max": 0.9879934072494507,
"sampling/sampling_logp_difference/mean": 0.004017754970118403,
"step": 9100,
"step_time": 6.5754276179912265
},
{
"clip_ratio/high_max": 1.7482518160250038e-05,
"clip_ratio/high_mean": 2.1853147700312547e-06,
"clip_ratio/low_mean": 5.5466728099418106e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 7.731987579973065e-06,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1191.7,
"completions/max_terminated_length": 1151.5,
"completions/mean_length": 179.404296875,
"completions/mean_terminated_length": 156.10360107421874,
"completions/min_length": 73.8,
"completions/min_terminated_length": 73.8,
"entropy": 0.04221254352014512,
"epoch": 19.507494646680943,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.08740234375,
"learning_rate": 9.0891e-06,
"loss": -0.007,
"num_tokens": 926187824.0,
"reward": 1.0487695574760436,
"reward_std": 0.18227342888712883,
"rewards/reward_accuracy/mean": 0.95,
"rewards/reward_accuracy/std": 0.17867215871810913,
"rewards/reward_format/mean": 0.09876953288912774,
"rewards/reward_format/std": 0.005567053495906293,
"sampling/importance_sampling_ratio/max": 2.351033639907837,
"sampling/importance_sampling_ratio/mean": 0.9873854994773865,
"sampling/importance_sampling_ratio/min": 0.15005322126671672,
"sampling/sampling_logp_difference/max": 1.0683269560337068,
"sampling/sampling_logp_difference/mean": 0.0038984086830168964,
"step": 9110,
"step_time": 6.274187220301246
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1376.1,
"completions/max_terminated_length": 1144.9,
"completions/mean_length": 164.29375,
"completions/mean_terminated_length": 153.3367141723633,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.05010971059091389,
"epoch": 19.528907922912204,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.1962890625,
"learning_rate": 9.0881e-06,
"loss": -0.0157,
"num_tokens": 927125392.0,
"reward": 1.0714453220367433,
"reward_std": 0.12865128219127656,
"rewards/reward_accuracy/mean": 0.971875,
"rewards/reward_accuracy/std": 0.1271209627389908,
"rewards/reward_format/mean": 0.09957031384110451,
"rewards/reward_format/std": 0.004181885835714638,
"sampling/importance_sampling_ratio/max": 2.494255232810974,
"sampling/importance_sampling_ratio/mean": 0.9902954280376435,
"sampling/importance_sampling_ratio/min": 0.10009279791265727,
"sampling/sampling_logp_difference/max": 1.0103832721710204,
"sampling/sampling_logp_difference/mean": 0.004509749100543558,
"step": 9120,
"step_time": 6.677860826315009
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1353.9,
"completions/max_terminated_length": 1057.0,
"completions/mean_length": 154.260546875,
"completions/mean_terminated_length": 150.55845794677734,
"completions/min_length": 71.2,
"completions/min_terminated_length": 71.2,
"entropy": 0.04203747319988906,
"epoch": 19.550321199143468,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.6328125,
"learning_rate": 9.087100000000001e-06,
"loss": -0.0043,
"num_tokens": 928038747.0,
"reward": 1.0642773687839509,
"reward_std": 0.13004899471998216,
"rewards/reward_accuracy/mean": 0.964453125,
"rewards/reward_accuracy/std": 0.12889797016978263,
"rewards/reward_format/mean": 0.0998242199420929,
"rewards/reward_format/std": 0.0024446487659588456,
"sampling/importance_sampling_ratio/max": 2.4393879890441896,
"sampling/importance_sampling_ratio/mean": 0.9921684443950654,
"sampling/importance_sampling_ratio/min": 0.17049942910671234,
"sampling/sampling_logp_difference/max": 0.9856062769889832,
"sampling/sampling_logp_difference/mean": 0.003959052101708949,
"step": 9130,
"step_time": 6.452508281494374
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1262.9,
"completions/max_terminated_length": 928.1,
"completions/mean_length": 155.860546875,
"completions/mean_terminated_length": 149.97579040527344,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.040516328741796316,
"epoch": 19.571734475374733,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 9.086100000000001e-06,
"loss": -0.003,
"num_tokens": 928960102.0,
"reward": 1.0708398699760437,
"reward_std": 0.13475089892745018,
"rewards/reward_accuracy/mean": 0.97109375,
"rewards/reward_accuracy/std": 0.13331862762570382,
"rewards/reward_format/mean": 0.09974609538912774,
"rewards/reward_format/std": 0.0026277488097548483,
"sampling/importance_sampling_ratio/max": 2.510994243621826,
"sampling/importance_sampling_ratio/mean": 0.9963276743888855,
"sampling/importance_sampling_ratio/min": 0.13851780518889428,
"sampling/sampling_logp_difference/max": 0.9902512550354003,
"sampling/sampling_logp_difference/mean": 0.004013765230774879,
"step": 9140,
"step_time": 6.204349333001301
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1376.8,
"completions/max_terminated_length": 903.4,
"completions/mean_length": 140.123828125,
"completions/mean_terminated_length": 136.41134796142578,
"completions/min_length": 59.9,
"completions/min_terminated_length": 59.9,
"entropy": 0.0404211513698101,
"epoch": 19.593147751605997,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.259765625,
"learning_rate": 9.0851e-06,
"loss": -0.0029,
"num_tokens": 929837027.0,
"reward": 1.0834961175918578,
"reward_std": 0.09541865289211274,
"rewards/reward_accuracy/mean": 0.98359375,
"rewards/reward_accuracy/std": 0.0949003130197525,
"rewards/reward_format/mean": 0.09990234524011612,
"rewards/reward_format/std": 0.0006932690273970365,
"sampling/importance_sampling_ratio/max": 2.483359956741333,
"sampling/importance_sampling_ratio/mean": 0.9949602782726288,
"sampling/importance_sampling_ratio/min": 0.16228471249341964,
"sampling/sampling_logp_difference/max": 0.9493756413459777,
"sampling/sampling_logp_difference/mean": 0.003922982979565859,
"step": 9150,
"step_time": 6.6150822643016
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1597.1,
"completions/max_terminated_length": 1244.3,
"completions/mean_length": 161.07265625,
"completions/mean_terminated_length": 149.96783294677735,
"completions/min_length": 58.6,
"completions/min_terminated_length": 58.6,
"entropy": 0.044920145790092646,
"epoch": 19.614561027837258,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.33984375,
"learning_rate": 9.084100000000002e-06,
"loss": -0.0046,
"num_tokens": 930765101.0,
"reward": 1.0639844059944152,
"reward_std": 0.15105264410376548,
"rewards/reward_accuracy/mean": 0.964453125,
"rewards/reward_accuracy/std": 0.14956799969077111,
"rewards/reward_format/mean": 0.0995312511920929,
"rewards/reward_format/std": 0.003296602494083345,
"sampling/importance_sampling_ratio/max": 2.3591320753097533,
"sampling/importance_sampling_ratio/mean": 0.9820233762264252,
"sampling/importance_sampling_ratio/min": 0.06922904029488564,
"sampling/sampling_logp_difference/max": 1.0019013315439225,
"sampling/sampling_logp_difference/mean": 0.004096976364962757,
"step": 9160,
"step_time": 7.627668145505595
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1406.2,
"completions/max_terminated_length": 1272.9,
"completions/mean_length": 169.28515625,
"completions/mean_terminated_length": 159.29183807373047,
"completions/min_length": 69.6,
"completions/min_terminated_length": 69.6,
"entropy": 0.04872166495770216,
"epoch": 19.635974304068522,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0908203125,
"learning_rate": 9.0831e-06,
"loss": -0.0084,
"num_tokens": 931714727.0,
"reward": 1.057792979478836,
"reward_std": 0.14397084519732745,
"rewards/reward_accuracy/mean": 0.958203125,
"rewards/reward_accuracy/std": 0.1424979127943516,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.0038965378189459443,
"sampling/importance_sampling_ratio/max": 2.4524385213851927,
"sampling/importance_sampling_ratio/mean": 0.9944411635398864,
"sampling/importance_sampling_ratio/min": 0.07726041674613952,
"sampling/sampling_logp_difference/max": 0.8750919342041016,
"sampling/sampling_logp_difference/mean": 0.004225002136081457,
"step": 9170,
"step_time": 7.0734316982125165
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1520.6,
"completions/max_terminated_length": 1401.3,
"completions/mean_length": 162.48125,
"completions/mean_terminated_length": 155.14838104248048,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.04568749950267374,
"epoch": 19.657387580299787,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.65234375,
"learning_rate": 9.0821e-06,
"loss": -0.0103,
"num_tokens": 932644215.0,
"reward": 1.0730859637260437,
"reward_std": 0.14519534409046173,
"rewards/reward_accuracy/mean": 0.9734375,
"rewards/reward_accuracy/std": 0.14355655238032342,
"rewards/reward_format/mean": 0.09964843913912773,
"rewards/reward_format/std": 0.003859223937615752,
"sampling/importance_sampling_ratio/max": 2.364811027050018,
"sampling/importance_sampling_ratio/mean": 0.9837496995925903,
"sampling/importance_sampling_ratio/min": 0.13184744622558356,
"sampling/sampling_logp_difference/max": 0.8959391713142395,
"sampling/sampling_logp_difference/mean": 0.004344884119927883,
"step": 9180,
"step_time": 7.2060617718030695
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1276.7,
"completions/max_terminated_length": 1115.4,
"completions/mean_length": 166.728515625,
"completions/mean_terminated_length": 154.56076049804688,
"completions/min_length": 64.4,
"completions/min_terminated_length": 64.4,
"entropy": 0.042027830402366816,
"epoch": 19.678800856531048,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.3125,
"learning_rate": 9.0811e-06,
"loss": -0.0098,
"num_tokens": 933587328.0,
"reward": 1.0778906643390656,
"reward_std": 0.12136476784944535,
"rewards/reward_accuracy/mean": 0.978515625,
"rewards/reward_accuracy/std": 0.11815777570009231,
"rewards/reward_format/mean": 0.09937500283122062,
"rewards/reward_format/std": 0.005091836443170905,
"sampling/importance_sampling_ratio/max": 2.641832447052002,
"sampling/importance_sampling_ratio/mean": 0.9863425850868225,
"sampling/importance_sampling_ratio/min": 0.058438942581415174,
"sampling/sampling_logp_difference/max": 1.042513370513916,
"sampling/sampling_logp_difference/mean": 0.004008881514891982,
"step": 9190,
"step_time": 6.443508336693048
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1506.8,
"completions/max_terminated_length": 1280.9,
"completions/mean_length": 156.292578125,
"completions/mean_terminated_length": 148.92269134521484,
"completions/min_length": 62.4,
"completions/min_terminated_length": 62.4,
"entropy": 0.03892897937912494,
"epoch": 19.700214132762312,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.1875,
"learning_rate": 9.080100000000001e-06,
"loss": -0.0048,
"num_tokens": 934505213.0,
"reward": 1.0733789205551147,
"reward_std": 0.1390247829258442,
"rewards/reward_accuracy/mean": 0.973828125,
"rewards/reward_accuracy/std": 0.13664163202047347,
"rewards/reward_format/mean": 0.09955078214406968,
"rewards/reward_format/std": 0.00482239224947989,
"sampling/importance_sampling_ratio/max": 2.366521680355072,
"sampling/importance_sampling_ratio/mean": 0.9891993939876557,
"sampling/importance_sampling_ratio/min": 0.15461856946349145,
"sampling/sampling_logp_difference/max": 0.8966122627258301,
"sampling/sampling_logp_difference/mean": 0.0036756233079358936,
"step": 9200,
"step_time": 7.354741018085042
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1174.9,
"completions/max_terminated_length": 1155.3,
"completions/mean_length": 161.548828125,
"completions/mean_terminated_length": 154.36127014160155,
"completions/min_length": 59.8,
"completions/min_terminated_length": 59.8,
"entropy": 0.04335235476028174,
"epoch": 19.721627408993577,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.59765625,
"learning_rate": 9.079100000000001e-06,
"loss": -0.0037,
"num_tokens": 935437210.0,
"reward": 1.0484570562839508,
"reward_std": 0.16211699396371843,
"rewards/reward_accuracy/mean": 0.948828125,
"rewards/reward_accuracy/std": 0.16106317192316055,
"rewards/reward_format/mean": 0.09962890744209289,
"rewards/reward_format/std": 0.0026997233973816035,
"sampling/importance_sampling_ratio/max": 2.5133602738380434,
"sampling/importance_sampling_ratio/mean": 0.9905565202236175,
"sampling/importance_sampling_ratio/min": 0.15421737655997275,
"sampling/sampling_logp_difference/max": 0.9683779597282409,
"sampling/sampling_logp_difference/mean": 0.003938327357172966,
"step": 9210,
"step_time": 5.9624404192931255
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 1123.3,
"completions/max_terminated_length": 1116.2,
"completions/mean_length": 141.4328125,
"completions/mean_terminated_length": 140.69379119873048,
"completions/min_length": 62.6,
"completions/min_terminated_length": 62.6,
"entropy": 0.03904386968351901,
"epoch": 19.74304068522484,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 9.0781e-06,
"loss": -0.0021,
"num_tokens": 936314142.0,
"reward": 1.0694140791893005,
"reward_std": 0.13977839648723603,
"rewards/reward_accuracy/mean": 0.96953125,
"rewards/reward_accuracy/std": 0.13943707793951035,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.0012463126797229052,
"sampling/importance_sampling_ratio/max": 2.3731379985809324,
"sampling/importance_sampling_ratio/mean": 0.991752427816391,
"sampling/importance_sampling_ratio/min": 0.18334167152643205,
"sampling/sampling_logp_difference/max": 0.8368129968643189,
"sampling/sampling_logp_difference/mean": 0.003842264274135232,
"step": 9220,
"step_time": 5.531950381206116
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1533.3,
"completions/max_terminated_length": 1317.3,
"completions/mean_length": 172.378515625,
"completions/mean_terminated_length": 160.7502227783203,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.046241272171027956,
"epoch": 19.764453961456102,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.94921875,
"learning_rate": 9.077100000000002e-06,
"loss": -0.0002,
"num_tokens": 937278407.0,
"reward": 1.044335961341858,
"reward_std": 0.18842110857367517,
"rewards/reward_accuracy/mean": 0.944921875,
"rewards/reward_accuracy/std": 0.18610547706484795,
"rewards/reward_format/mean": 0.09941406399011612,
"rewards/reward_format/std": 0.004714712197892368,
"sampling/importance_sampling_ratio/max": 2.5000436305999756,
"sampling/importance_sampling_ratio/mean": 0.9808768093585968,
"sampling/importance_sampling_ratio/min": 0.134797865152359,
"sampling/sampling_logp_difference/max": 0.8992875576019287,
"sampling/sampling_logp_difference/mean": 0.004206507070921362,
"step": 9230,
"step_time": 7.500069306709338
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 892.7,
"completions/max_terminated_length": 878.4,
"completions/mean_length": 150.60234375,
"completions/mean_terminated_length": 146.21039123535155,
"completions/min_length": 62.0,
"completions/min_terminated_length": 62.0,
"entropy": 0.04056527968496084,
"epoch": 19.785867237687366,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 9.076100000000001e-06,
"loss": 0.0011,
"num_tokens": 938171485.0,
"reward": 1.056445336341858,
"reward_std": 0.17333496361970901,
"rewards/reward_accuracy/mean": 0.956640625,
"rewards/reward_accuracy/std": 0.17275590747594832,
"rewards/reward_format/mean": 0.09980468899011612,
"rewards/reward_format/std": 0.0014187667053192853,
"sampling/importance_sampling_ratio/max": 2.47431960105896,
"sampling/importance_sampling_ratio/mean": 0.9967647671699524,
"sampling/importance_sampling_ratio/min": 0.17677096873521805,
"sampling/sampling_logp_difference/max": 1.0543083131313324,
"sampling/sampling_logp_difference/mean": 0.0039816384203732015,
"step": 9240,
"step_time": 4.758709389789146
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1359.5,
"completions/max_terminated_length": 1248.0,
"completions/mean_length": 164.598046875,
"completions/mean_terminated_length": 155.85336608886718,
"completions/min_length": 62.3,
"completions/min_terminated_length": 62.3,
"entropy": 0.044497970049269496,
"epoch": 19.80728051391863,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.28125,
"learning_rate": 9.0751e-06,
"loss": -0.0022,
"num_tokens": 939114200.0,
"reward": 1.070312511920929,
"reward_std": 0.150006752461195,
"rewards/reward_accuracy/mean": 0.970703125,
"rewards/reward_accuracy/std": 0.14816323220729827,
"rewards/reward_format/mean": 0.09960937574505806,
"rewards/reward_format/std": 0.004018527013249696,
"sampling/importance_sampling_ratio/max": 2.307345652580261,
"sampling/importance_sampling_ratio/mean": 0.9720366656780243,
"sampling/importance_sampling_ratio/min": 0.0670137882232666,
"sampling/sampling_logp_difference/max": 1.149421513080597,
"sampling/sampling_logp_difference/mean": 0.0042013704078271985,
"step": 9250,
"step_time": 6.658384925799328
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1678.4,
"completions/max_terminated_length": 1314.6,
"completions/mean_length": 174.54140625,
"completions/mean_terminated_length": 162.15361328125,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.04973840469028801,
"epoch": 19.82869379014989,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.1953125,
"learning_rate": 9.074100000000002e-06,
"loss": -0.005,
"num_tokens": 940085954.0,
"reward": 1.0541601717472076,
"reward_std": 0.1872320644557476,
"rewards/reward_accuracy/mean": 0.9546875,
"rewards/reward_accuracy/std": 0.18513632714748382,
"rewards/reward_format/mean": 0.09947265684604645,
"rewards/reward_format/std": 0.004184468556195498,
"sampling/importance_sampling_ratio/max": 2.4736761331558226,
"sampling/importance_sampling_ratio/mean": 0.9811668157577514,
"sampling/importance_sampling_ratio/min": 0.09651762992143631,
"sampling/sampling_logp_difference/max": 0.8692919731140136,
"sampling/sampling_logp_difference/mean": 0.004352953261695802,
"step": 9260,
"step_time": 8.195330532212392
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1311.4,
"completions/max_terminated_length": 1180.8,
"completions/mean_length": 159.14296875,
"completions/mean_terminated_length": 150.3482925415039,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.04325949216727167,
"epoch": 19.850107066381156,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.0,
"learning_rate": 9.0731e-06,
"loss": -0.0062,
"num_tokens": 941010304.0,
"reward": 1.0671875178813934,
"reward_std": 0.14459482058882714,
"rewards/reward_accuracy/mean": 0.967578125,
"rewards/reward_accuracy/std": 0.1426117166876793,
"rewards/reward_format/mean": 0.09960937649011611,
"rewards/reward_format/std": 0.00395376228261739,
"sampling/importance_sampling_ratio/max": 2.6098911285400392,
"sampling/importance_sampling_ratio/mean": 0.9898800611495971,
"sampling/importance_sampling_ratio/min": 0.1241134449839592,
"sampling/sampling_logp_difference/max": 1.1428808331489564,
"sampling/sampling_logp_difference/mean": 0.0040014975005760785,
"step": 9270,
"step_time": 6.4126573625952
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1247.6,
"completions/max_terminated_length": 1137.1,
"completions/mean_length": 160.658984375,
"completions/mean_terminated_length": 145.20404663085938,
"completions/min_length": 67.4,
"completions/min_terminated_length": 67.4,
"entropy": 0.043734584399498996,
"epoch": 19.87152034261242,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 9.0721e-06,
"loss": -0.0078,
"num_tokens": 941933735.0,
"reward": 1.0729687690734864,
"reward_std": 0.12262352928519249,
"rewards/reward_accuracy/mean": 0.9734375,
"rewards/reward_accuracy/std": 0.12066189721226692,
"rewards/reward_format/mean": 0.0995312511920929,
"rewards/reward_format/std": 0.0031400540843605994,
"sampling/importance_sampling_ratio/max": 2.4998611330986025,
"sampling/importance_sampling_ratio/mean": 0.9940631508827209,
"sampling/importance_sampling_ratio/min": 0.1610862985253334,
"sampling/sampling_logp_difference/max": 0.8307618975639344,
"sampling/sampling_logp_difference/mean": 0.004068402107805014,
"step": 9280,
"step_time": 6.302560503710993
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1476.2,
"completions/max_terminated_length": 1379.4,
"completions/mean_length": 174.78125,
"completions/mean_terminated_length": 158.6860794067383,
"completions/min_length": 68.8,
"completions/min_terminated_length": 68.8,
"entropy": 0.048618609388358894,
"epoch": 19.89293361884368,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.28125,
"learning_rate": 9.0711e-06,
"loss": -0.0113,
"num_tokens": 942898247.0,
"reward": 1.0581054925918578,
"reward_std": 0.17270331755280494,
"rewards/reward_accuracy/mean": 0.958984375,
"rewards/reward_accuracy/std": 0.16894653365015982,
"rewards/reward_format/mean": 0.09912109449505806,
"rewards/reward_format/std": 0.006646971893496811,
"sampling/importance_sampling_ratio/max": 2.478123140335083,
"sampling/importance_sampling_ratio/mean": 0.9844117999076843,
"sampling/importance_sampling_ratio/min": 0.02847989946603775,
"sampling/sampling_logp_difference/max": 0.8517537713050842,
"sampling/sampling_logp_difference/mean": 0.00415471731685102,
"step": 9290,
"step_time": 7.436109899519943
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1355.7,
"completions/max_terminated_length": 979.0,
"completions/mean_length": 147.36640625,
"completions/mean_terminated_length": 140.6606872558594,
"completions/min_length": 65.3,
"completions/min_terminated_length": 65.3,
"entropy": 0.04262354166712612,
"epoch": 19.914346895074946,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.365234375,
"learning_rate": 9.0701e-06,
"loss": -0.0027,
"num_tokens": 943784209.0,
"reward": 1.077148449420929,
"reward_std": 0.1313104398548603,
"rewards/reward_accuracy/mean": 0.97734375,
"rewards/reward_accuracy/std": 0.1300644427537918,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.0027571488637477158,
"sampling/importance_sampling_ratio/max": 2.5119298458099366,
"sampling/importance_sampling_ratio/mean": 0.9903336584568023,
"sampling/importance_sampling_ratio/min": 0.15579649237915874,
"sampling/sampling_logp_difference/max": 0.943257337808609,
"sampling/sampling_logp_difference/mean": 0.004033864499069751,
"step": 9300,
"step_time": 6.673793797008694
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1511.6,
"completions/max_terminated_length": 1083.3,
"completions/mean_length": 153.125,
"completions/mean_terminated_length": 146.4762176513672,
"completions/min_length": 64.7,
"completions/min_terminated_length": 64.7,
"entropy": 0.04344698949716985,
"epoch": 19.93576017130621,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.2158203125,
"learning_rate": 9.069100000000001e-06,
"loss": -0.0096,
"num_tokens": 944689169.0,
"reward": 1.0783789157867432,
"reward_std": 0.09440934881567956,
"rewards/reward_accuracy/mean": 0.978515625,
"rewards/reward_accuracy/std": 0.09340007379651069,
"rewards/reward_format/mean": 0.09986328184604645,
"rewards/reward_format/std": 0.00181964875664562,
"sampling/importance_sampling_ratio/max": 2.4019203186035156,
"sampling/importance_sampling_ratio/mean": 0.9875817120075225,
"sampling/importance_sampling_ratio/min": 0.12948328237980605,
"sampling/sampling_logp_difference/max": 0.9341304004192352,
"sampling/sampling_logp_difference/mean": 0.004089133883826435,
"step": 9310,
"step_time": 7.068998748090235
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1634.7,
"completions/max_terminated_length": 1073.1,
"completions/mean_length": 171.680859375,
"completions/mean_terminated_length": 160.80465393066407,
"completions/min_length": 71.4,
"completions/min_terminated_length": 71.4,
"entropy": 0.04394675050862133,
"epoch": 19.957173447537475,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.08349609375,
"learning_rate": 9.0681e-06,
"loss": -0.0077,
"num_tokens": 945645840.0,
"reward": 1.0556445479393006,
"reward_std": 0.18649304136633874,
"rewards/reward_accuracy/mean": 0.95625,
"rewards/reward_accuracy/std": 0.18409454599022865,
"rewards/reward_format/mean": 0.09939453229308129,
"rewards/reward_format/std": 0.005257716891355813,
"sampling/importance_sampling_ratio/max": 2.53534734249115,
"sampling/importance_sampling_ratio/mean": 0.9750232875347138,
"sampling/importance_sampling_ratio/min": 0.09706297293305396,
"sampling/sampling_logp_difference/max": 1.0518281519412995,
"sampling/sampling_logp_difference/mean": 0.003971110144630074,
"step": 9320,
"step_time": 7.888220002214075
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1333.0,
"completions/max_terminated_length": 1074.9,
"completions/mean_length": 167.803515625,
"completions/mean_terminated_length": 157.61992492675782,
"completions/min_length": 63.5,
"completions/min_terminated_length": 63.5,
"entropy": 0.04739452642388642,
"epoch": 19.978586723768736,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.2314453125,
"learning_rate": 9.067100000000002e-06,
"loss": 0.0004,
"num_tokens": 946595785.0,
"reward": 1.0702734470367432,
"reward_std": 0.13588074073195458,
"rewards/reward_accuracy/mean": 0.970703125,
"rewards/reward_accuracy/std": 0.13390416651964188,
"rewards/reward_format/mean": 0.09957031309604644,
"rewards/reward_format/std": 0.004308584006503224,
"sampling/importance_sampling_ratio/max": 2.4303313493728638,
"sampling/importance_sampling_ratio/mean": 0.9859449565410614,
"sampling/importance_sampling_ratio/min": 0.11252655480057001,
"sampling/sampling_logp_difference/max": 1.232719326019287,
"sampling/sampling_logp_difference/mean": 0.0040267204167321324,
"step": 9330,
"step_time": 6.792306689103134
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1421.1,
"completions/max_terminated_length": 1027.7,
"completions/mean_length": 144.893359375,
"completions/mean_terminated_length": 140.45290908813476,
"completions/min_length": 61.9,
"completions/min_terminated_length": 61.9,
"entropy": 0.04007145266514271,
"epoch": 20.0,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 9.066100000000001e-06,
"loss": -0.0042,
"num_tokens": 947480728.0,
"reward": 1.0801953434944154,
"reward_std": 0.10916821435093879,
"rewards/reward_accuracy/mean": 0.98046875,
"rewards/reward_accuracy/std": 0.10698845535516739,
"rewards/reward_format/mean": 0.09972656443715096,
"rewards/reward_format/std": 0.0032802829751744866,
"sampling/importance_sampling_ratio/max": 2.3716767191886903,
"sampling/importance_sampling_ratio/mean": 0.99602370262146,
"sampling/importance_sampling_ratio/min": 0.1327689364552498,
"sampling/sampling_logp_difference/max": 1.0532543540000916,
"sampling/sampling_logp_difference/mean": 0.0038920431630685925,
"step": 9340,
"step_time": 6.723236110794824
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1345.2,
"completions/max_terminated_length": 1175.7,
"completions/mean_length": 162.058203125,
"completions/mean_terminated_length": 155.41929931640624,
"completions/min_length": 67.2,
"completions/min_terminated_length": 67.2,
"entropy": 0.04044292059261352,
"epoch": 20.021413276231264,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0,
"learning_rate": 9.0651e-06,
"loss": -0.0009,
"num_tokens": 948414173.0,
"reward": 1.0742773532867431,
"reward_std": 0.11580076217651367,
"rewards/reward_accuracy/mean": 0.974609375,
"rewards/reward_accuracy/std": 0.1140778049826622,
"rewards/reward_format/mean": 0.09966796934604645,
"rewards/reward_format/std": 0.003703578980639577,
"sampling/importance_sampling_ratio/max": 2.3296339988708494,
"sampling/importance_sampling_ratio/mean": 0.9858010351657868,
"sampling/importance_sampling_ratio/min": 0.11381863132119178,
"sampling/sampling_logp_difference/max": 0.9196881651878357,
"sampling/sampling_logp_difference/mean": 0.00370923129376024,
"step": 9350,
"step_time": 6.672289056898444
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1361.5,
"completions/max_terminated_length": 1023.2,
"completions/mean_length": 155.12265625,
"completions/mean_terminated_length": 147.73615112304688,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.039720779610797764,
"epoch": 20.042826552462525,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.337890625,
"learning_rate": 9.064100000000002e-06,
"loss": -0.0075,
"num_tokens": 949328759.0,
"reward": 1.069589865207672,
"reward_std": 0.14615373760461808,
"rewards/reward_accuracy/mean": 0.969921875,
"rewards/reward_accuracy/std": 0.14443112909793854,
"rewards/reward_format/mean": 0.09966797009110451,
"rewards/reward_format/std": 0.002704807138070464,
"sampling/importance_sampling_ratio/max": 2.3106245517730715,
"sampling/importance_sampling_ratio/mean": 0.9913569092750549,
"sampling/importance_sampling_ratio/min": 0.0618774875998497,
"sampling/sampling_logp_difference/max": 1.048514986038208,
"sampling/sampling_logp_difference/mean": 0.0037586273159831763,
"step": 9360,
"step_time": 6.789473616005853
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1345.2,
"completions/max_terminated_length": 1122.8,
"completions/mean_length": 159.399609375,
"completions/mean_terminated_length": 149.05558013916016,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.04735657901037484,
"epoch": 20.06423982869379,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.15234375,
"learning_rate": 9.0631e-06,
"loss": -0.0053,
"num_tokens": 950255286.0,
"reward": 1.0525000154972077,
"reward_std": 0.18012357503175735,
"rewards/reward_accuracy/mean": 0.952734375,
"rewards/reward_accuracy/std": 0.17928635105490684,
"rewards/reward_format/mean": 0.09976562559604644,
"rewards/reward_format/std": 0.00286459915805608,
"sampling/importance_sampling_ratio/max": 2.3825217843055726,
"sampling/importance_sampling_ratio/mean": 0.9727106511592865,
"sampling/importance_sampling_ratio/min": 0.0938889380544424,
"sampling/sampling_logp_difference/max": 0.8326278388500213,
"sampling/sampling_logp_difference/mean": 0.004262265050783753,
"step": 9370,
"step_time": 6.564493247389327
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1311.8,
"completions/max_terminated_length": 1146.2,
"completions/mean_length": 163.644140625,
"completions/mean_terminated_length": 152.6379852294922,
"completions/min_length": 60.1,
"completions/min_terminated_length": 60.1,
"entropy": 0.045527439564466476,
"epoch": 20.085653104925054,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.2373046875,
"learning_rate": 9.062100000000001e-06,
"loss": -0.0048,
"num_tokens": 951190087.0,
"reward": 1.0533203482627869,
"reward_std": 0.18657502830028533,
"rewards/reward_accuracy/mean": 0.95390625,
"rewards/reward_accuracy/std": 0.1842903919517994,
"rewards/reward_format/mean": 0.09941406324505805,
"rewards/reward_format/std": 0.005070122145116329,
"sampling/importance_sampling_ratio/max": 2.4318507432937624,
"sampling/importance_sampling_ratio/mean": 0.9817586898803711,
"sampling/importance_sampling_ratio/min": 0.07356930300593376,
"sampling/sampling_logp_difference/max": 1.01357399225235,
"sampling/sampling_logp_difference/mean": 0.004130539135076106,
"step": 9380,
"step_time": 6.496129494291381
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1491.1,
"completions/max_terminated_length": 1379.6,
"completions/mean_length": 161.451171875,
"completions/mean_terminated_length": 149.88872375488282,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.04665433941408992,
"epoch": 20.10706638115632,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.07861328125,
"learning_rate": 9.0611e-06,
"loss": -0.0017,
"num_tokens": 952117210.0,
"reward": 1.0583984673023223,
"reward_std": 0.17875355258584022,
"rewards/reward_accuracy/mean": 0.958984375,
"rewards/reward_accuracy/std": 0.17626309245824814,
"rewards/reward_format/mean": 0.09941406473517418,
"rewards/reward_format/std": 0.004754358367063105,
"sampling/importance_sampling_ratio/max": 2.434252715110779,
"sampling/importance_sampling_ratio/mean": 0.9875102400779724,
"sampling/importance_sampling_ratio/min": 0.15254462426528334,
"sampling/sampling_logp_difference/max": 0.8677175343036652,
"sampling/sampling_logp_difference/mean": 0.004187268717214465,
"step": 9390,
"step_time": 7.321105971807265
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1610.9,
"completions/max_terminated_length": 1392.8,
"completions/mean_length": 181.35625,
"completions/mean_terminated_length": 169.75983581542968,
"completions/min_length": 62.2,
"completions/min_terminated_length": 62.2,
"entropy": 0.053832035162486136,
"epoch": 20.12847965738758,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.2890625,
"learning_rate": 9.0601e-06,
"loss": -0.0068,
"num_tokens": 953101018.0,
"reward": 1.0545898795127868,
"reward_std": 0.17904602140188217,
"rewards/reward_accuracy/mean": 0.955078125,
"rewards/reward_accuracy/std": 0.177571789175272,
"rewards/reward_format/mean": 0.09951172098517418,
"rewards/reward_format/std": 0.004116833722218871,
"sampling/importance_sampling_ratio/max": 2.5676842212677,
"sampling/importance_sampling_ratio/mean": 0.9819579243659973,
"sampling/importance_sampling_ratio/min": 0.0942208107560873,
"sampling/sampling_logp_difference/max": 0.9608686864376068,
"sampling/sampling_logp_difference/mean": 0.0043137150816619394,
"step": 9400,
"step_time": 7.835155371887959
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1493.7,
"completions/max_terminated_length": 1322.2,
"completions/mean_length": 194.458984375,
"completions/mean_terminated_length": 180.0866256713867,
"completions/min_length": 68.9,
"completions/min_terminated_length": 68.9,
"entropy": 0.05034385204780847,
"epoch": 20.149892933618844,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.54296875,
"learning_rate": 9.059100000000001e-06,
"loss": -0.0163,
"num_tokens": 954116401.0,
"reward": 1.0409570455551147,
"reward_std": 0.18526218757033347,
"rewards/reward_accuracy/mean": 0.941796875,
"rewards/reward_accuracy/std": 0.18317311778664588,
"rewards/reward_format/mean": 0.09916015714406967,
"rewards/reward_format/std": 0.005122917634434998,
"sampling/importance_sampling_ratio/max": 2.54710738658905,
"sampling/importance_sampling_ratio/mean": 0.9915246546268464,
"sampling/importance_sampling_ratio/min": 0.1006782367825508,
"sampling/sampling_logp_difference/max": 1.0424758732318877,
"sampling/sampling_logp_difference/mean": 0.004023418808355927,
"step": 9410,
"step_time": 7.249125418195035
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1071.1,
"completions/max_terminated_length": 816.8,
"completions/mean_length": 164.32265625,
"completions/mean_terminated_length": 147.33380432128905,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.04602664897684008,
"epoch": 20.17130620985011,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.53125,
"learning_rate": 9.0581e-06,
"loss": -0.0029,
"num_tokens": 955056507.0,
"reward": 1.0590429902076721,
"reward_std": 0.1384725958108902,
"rewards/reward_accuracy/mean": 0.959765625,
"rewards/reward_accuracy/std": 0.13546039164066315,
"rewards/reward_format/mean": 0.09927734434604644,
"rewards/reward_format/std": 0.004545686021447182,
"sampling/importance_sampling_ratio/max": 2.468275046348572,
"sampling/importance_sampling_ratio/mean": 0.9870678782463074,
"sampling/importance_sampling_ratio/min": 0.08944500647485257,
"sampling/sampling_logp_difference/max": 0.992816036939621,
"sampling/sampling_logp_difference/mean": 0.0041549933375790715,
"step": 9420,
"step_time": 5.5071119681902925
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1325.0,
"completions/max_terminated_length": 1203.9,
"completions/mean_length": 156.590625,
"completions/mean_terminated_length": 153.66856536865234,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.03629914382472634,
"epoch": 20.19271948608137,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.64453125,
"learning_rate": 9.0571e-06,
"loss": -0.0042,
"num_tokens": 955982179.0,
"reward": 1.0741015791893005,
"reward_std": 0.13046502843499183,
"rewards/reward_accuracy/mean": 0.97421875,
"rewards/reward_accuracy/std": 0.12984965443611146,
"rewards/reward_format/mean": 0.09988281428813935,
"rewards/reward_format/std": 0.001387959998100996,
"sampling/importance_sampling_ratio/max": 2.3332061886787416,
"sampling/importance_sampling_ratio/mean": 0.9905461966991425,
"sampling/importance_sampling_ratio/min": 0.13019719943404198,
"sampling/sampling_logp_difference/max": 0.7900533437728882,
"sampling/sampling_logp_difference/mean": 0.0036035147961229084,
"step": 9430,
"step_time": 6.407836585197947
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 877.0,
"completions/max_terminated_length": 877.0,
"completions/mean_length": 138.398046875,
"completions/mean_terminated_length": 138.398046875,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.034330667741596696,
"epoch": 20.214132762312634,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 9.056100000000001e-06,
"loss": -0.0007,
"num_tokens": 956850286.0,
"reward": 1.0753515720367433,
"reward_std": 0.11119671985507011,
"rewards/reward_accuracy/mean": 0.975390625,
"rewards/reward_accuracy/std": 0.1107427716255188,
"rewards/reward_format/mean": 0.09996093809604645,
"rewards/reward_format/std": 0.0006250000093132258,
"sampling/importance_sampling_ratio/max": 2.3766231417655943,
"sampling/importance_sampling_ratio/mean": 0.9998860478401184,
"sampling/importance_sampling_ratio/min": 0.09883081316947936,
"sampling/sampling_logp_difference/max": 0.9398551166057587,
"sampling/sampling_logp_difference/mean": 0.0035083564696833493,
"step": 9440,
"step_time": 4.37504940989893
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1624.9,
"completions/max_terminated_length": 1570.3,
"completions/mean_length": 180.540625,
"completions/mean_terminated_length": 161.5354248046875,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.04973271593917161,
"epoch": 20.235546038543898,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.060302734375,
"learning_rate": 9.0551e-06,
"loss": -0.0021,
"num_tokens": 957835718.0,
"reward": 1.051757848262787,
"reward_std": 0.18331062123179437,
"rewards/reward_accuracy/mean": 0.95234375,
"rewards/reward_accuracy/std": 0.1812161035835743,
"rewards/reward_format/mean": 0.09941406473517418,
"rewards/reward_format/std": 0.004721870832145214,
"sampling/importance_sampling_ratio/max": 2.5286498785018923,
"sampling/importance_sampling_ratio/mean": 0.9814455568790436,
"sampling/importance_sampling_ratio/min": 0.11587035749107599,
"sampling/sampling_logp_difference/max": 1.029928332567215,
"sampling/sampling_logp_difference/mean": 0.004098524688743055,
"step": 9450,
"step_time": 8.1751138036052
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1433.3,
"completions/max_terminated_length": 1305.1,
"completions/mean_length": 166.280078125,
"completions/mean_terminated_length": 155.3249755859375,
"completions/min_length": 63.5,
"completions/min_terminated_length": 63.5,
"entropy": 0.051701027411036195,
"epoch": 20.25695931477516,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.455078125,
"learning_rate": 9.054100000000002e-06,
"loss": -0.0079,
"num_tokens": 958781331.0,
"reward": 1.0390234589576721,
"reward_std": 0.20734305754303933,
"rewards/reward_accuracy/mean": 0.939453125,
"rewards/reward_accuracy/std": 0.20588796064257622,
"rewards/reward_format/mean": 0.09957031384110451,
"rewards/reward_format/std": 0.0036582039436325433,
"sampling/importance_sampling_ratio/max": 2.645045590400696,
"sampling/importance_sampling_ratio/mean": 1.0013889849185944,
"sampling/importance_sampling_ratio/min": 0.13209223989397287,
"sampling/sampling_logp_difference/max": 0.9785064697265625,
"sampling/sampling_logp_difference/mean": 0.004608100303448737,
"step": 9460,
"step_time": 7.190017719799653
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1001.4,
"completions/max_terminated_length": 853.4,
"completions/mean_length": 141.34609375,
"completions/mean_terminated_length": 139.13148498535156,
"completions/min_length": 63.7,
"completions/min_terminated_length": 63.7,
"entropy": 0.03639424422290176,
"epoch": 20.278372591006423,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.2216796875,
"learning_rate": 9.0531e-06,
"loss": -0.0056,
"num_tokens": 959655209.0,
"reward": 1.0753125250339508,
"reward_std": 0.10329387784004211,
"rewards/reward_accuracy/mean": 0.975390625,
"rewards/reward_accuracy/std": 0.10295080244541169,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.0012500001117587089,
"sampling/importance_sampling_ratio/max": 2.4860294818878175,
"sampling/importance_sampling_ratio/mean": 0.9978863000869751,
"sampling/importance_sampling_ratio/min": 0.21435419134795666,
"sampling/sampling_logp_difference/max": 1.099455440044403,
"sampling/sampling_logp_difference/mean": 0.003741220152005553,
"step": 9470,
"step_time": 4.914625552020152
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1193.2,
"completions/max_terminated_length": 870.3,
"completions/mean_length": 153.487890625,
"completions/mean_terminated_length": 150.54672088623047,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.03890302076470107,
"epoch": 20.299785867237688,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 9.052100000000001e-06,
"loss": -0.0038,
"num_tokens": 960560298.0,
"reward": 1.0818359494209289,
"reward_std": 0.0849307008087635,
"rewards/reward_accuracy/mean": 0.98203125,
"rewards/reward_accuracy/std": 0.08383304327726364,
"rewards/reward_format/mean": 0.09980468899011612,
"rewards/reward_format/std": 0.002496312838047743,
"sampling/importance_sampling_ratio/max": 2.5117289781570435,
"sampling/importance_sampling_ratio/mean": 0.9870851933956146,
"sampling/importance_sampling_ratio/min": 0.07547296583652496,
"sampling/sampling_logp_difference/max": 1.0106294393539428,
"sampling/sampling_logp_difference/mean": 0.003670630045235157,
"step": 9480,
"step_time": 5.826437371419161
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1209.9,
"completions/max_terminated_length": 1090.8,
"completions/mean_length": 168.891796875,
"completions/mean_terminated_length": 163.20494537353517,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.05045470481272787,
"epoch": 20.321199143468952,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.251953125,
"learning_rate": 9.0511e-06,
"loss": -0.0038,
"num_tokens": 961505589.0,
"reward": 1.066503930091858,
"reward_std": 0.1360071673989296,
"rewards/reward_accuracy/mean": 0.966796875,
"rewards/reward_accuracy/std": 0.13479650765657425,
"rewards/reward_format/mean": 0.09970703274011612,
"rewards/reward_format/std": 0.003108725417405367,
"sampling/importance_sampling_ratio/max": 2.4765459537506103,
"sampling/importance_sampling_ratio/mean": 0.9811253249645233,
"sampling/importance_sampling_ratio/min": 0.11703294068574906,
"sampling/sampling_logp_difference/max": 0.9275227963924408,
"sampling/sampling_logp_difference/mean": 0.004330472322180867,
"step": 9490,
"step_time": 5.993466671285569
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1382.9,
"completions/max_terminated_length": 911.3,
"completions/mean_length": 160.083203125,
"completions/mean_terminated_length": 146.19298706054687,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"entropy": 0.04240153757855296,
"epoch": 20.342612419700213,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.10595703125,
"learning_rate": 9.0501e-06,
"loss": -0.0002,
"num_tokens": 962427658.0,
"reward": 1.067441427707672,
"reward_std": 0.13378586918115615,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.1305855117738247,
"rewards/reward_format/mean": 0.0994726575911045,
"rewards/reward_format/std": 0.005166800413280726,
"sampling/importance_sampling_ratio/max": 2.3976157546043395,
"sampling/importance_sampling_ratio/mean": 0.9750724494457245,
"sampling/importance_sampling_ratio/min": 0.11908239275217056,
"sampling/sampling_logp_difference/max": 1.1896399140357972,
"sampling/sampling_logp_difference/mean": 0.004200600483454764,
"step": 9500,
"step_time": 6.901236307108775
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1236.8,
"completions/max_terminated_length": 1128.2,
"completions/mean_length": 165.68828125,
"completions/mean_terminated_length": 153.9628936767578,
"completions/min_length": 67.8,
"completions/min_terminated_length": 67.8,
"entropy": 0.04450862009543925,
"epoch": 20.364025695931478,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.44140625,
"learning_rate": 9.049100000000001e-06,
"loss": -0.0054,
"num_tokens": 963371580.0,
"reward": 1.0546289205551147,
"reward_std": 0.17597879394888877,
"rewards/reward_accuracy/mean": 0.955078125,
"rewards/reward_accuracy/std": 0.17418815568089485,
"rewards/reward_format/mean": 0.09955078214406968,
"rewards/reward_format/std": 0.003407853958196938,
"sampling/importance_sampling_ratio/max": 2.471558403968811,
"sampling/importance_sampling_ratio/mean": 0.985941344499588,
"sampling/importance_sampling_ratio/min": 0.09461317569948732,
"sampling/sampling_logp_difference/max": 1.2015014350414277,
"sampling/sampling_logp_difference/mean": 0.004069261578842997,
"step": 9510,
"step_time": 6.335228195402306
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1289.2,
"completions/max_terminated_length": 1071.2,
"completions/mean_length": 162.18359375,
"completions/mean_terminated_length": 155.54507141113282,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"entropy": 0.04350784970447421,
"epoch": 20.385438972162742,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.2275390625,
"learning_rate": 9.0481e-06,
"loss": -0.0069,
"num_tokens": 964302770.0,
"reward": 1.0719726741313935,
"reward_std": 0.11955861747264862,
"rewards/reward_accuracy/mean": 0.972265625,
"rewards/reward_accuracy/std": 0.11762885004281998,
"rewards/reward_format/mean": 0.09970703274011612,
"rewards/reward_format/std": 0.003592783026397228,
"sampling/importance_sampling_ratio/max": 2.3742625951766967,
"sampling/importance_sampling_ratio/mean": 0.9810491383075715,
"sampling/importance_sampling_ratio/min": 0.14034995287656785,
"sampling/sampling_logp_difference/max": 0.9687917709350586,
"sampling/sampling_logp_difference/mean": 0.004168678098358214,
"step": 9520,
"step_time": 6.307379948717426
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 897.2,
"completions/max_terminated_length": 773.0,
"completions/mean_length": 143.0296875,
"completions/mean_terminated_length": 137.85130310058594,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.03579169916920364,
"epoch": 20.406852248394003,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.34765625,
"learning_rate": 9.0471e-06,
"loss": -0.0034,
"num_tokens": 965181118.0,
"reward": 1.082578146457672,
"reward_std": 0.10529829487204552,
"rewards/reward_accuracy/mean": 0.9828125,
"rewards/reward_accuracy/std": 0.10414503142237663,
"rewards/reward_format/mean": 0.09976562559604644,
"rewards/reward_format/std": 0.0021565564908087253,
"sampling/importance_sampling_ratio/max": 2.560510015487671,
"sampling/importance_sampling_ratio/mean": 0.9929108798503876,
"sampling/importance_sampling_ratio/min": 0.20360058844089507,
"sampling/sampling_logp_difference/max": 0.8361933827400208,
"sampling/sampling_logp_difference/mean": 0.003481644671410322,
"step": 9530,
"step_time": 4.572268179102684
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1445.1,
"completions/max_terminated_length": 1208.4,
"completions/mean_length": 157.023828125,
"completions/mean_terminated_length": 151.8783386230469,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.044685054174624386,
"epoch": 20.428265524625267,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.279296875,
"learning_rate": 9.046100000000001e-06,
"loss": -0.0002,
"num_tokens": 966100811.0,
"reward": 1.039160180091858,
"reward_std": 0.22344380393624305,
"rewards/reward_accuracy/mean": 0.939453125,
"rewards/reward_accuracy/std": 0.22244866639375688,
"rewards/reward_format/mean": 0.09970703199505807,
"rewards/reward_format/std": 0.0033807744970545174,
"sampling/importance_sampling_ratio/max": 2.683739113807678,
"sampling/importance_sampling_ratio/mean": 0.9903630375862121,
"sampling/importance_sampling_ratio/min": 0.12350250780582428,
"sampling/sampling_logp_difference/max": 0.9140732049942016,
"sampling/sampling_logp_difference/mean": 0.004286891780793667,
"step": 9540,
"step_time": 7.01554952749575
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1255.6,
"completions/max_terminated_length": 830.8,
"completions/mean_length": 141.741015625,
"completions/mean_terminated_length": 138.02126083374023,
"completions/min_length": 62.7,
"completions/min_terminated_length": 62.7,
"entropy": 0.033445628848858176,
"epoch": 20.449678800856532,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.345703125,
"learning_rate": 9.045100000000001e-06,
"loss": 0.0004,
"num_tokens": 966978004.0,
"reward": 1.0838672161102294,
"reward_std": 0.10716498345136642,
"rewards/reward_accuracy/mean": 0.983984375,
"rewards/reward_accuracy/std": 0.10619137287139893,
"rewards/reward_format/mean": 0.09988281428813935,
"rewards/reward_format/std": 0.0015071487054228784,
"sampling/importance_sampling_ratio/max": 2.4760379076004027,
"sampling/importance_sampling_ratio/mean": 0.991464227437973,
"sampling/importance_sampling_ratio/min": 0.1796190358698368,
"sampling/sampling_logp_difference/max": 0.9984344959259033,
"sampling/sampling_logp_difference/mean": 0.003547860705293715,
"step": 9550,
"step_time": 6.049143508501584
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1526.9,
"completions/max_terminated_length": 1006.2,
"completions/mean_length": 150.159765625,
"completions/mean_terminated_length": 142.75415496826173,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.04088811215478927,
"epoch": 20.471092077087796,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.052001953125,
"learning_rate": 9.044100000000002e-06,
"loss": -0.0019,
"num_tokens": 967881469.0,
"reward": 1.0805273652076721,
"reward_std": 0.11727106422185898,
"rewards/reward_accuracy/mean": 0.980859375,
"rewards/reward_accuracy/std": 0.11472610384225845,
"rewards/reward_format/mean": 0.09966797009110451,
"rewards/reward_format/std": 0.004013260779902339,
"sampling/importance_sampling_ratio/max": 2.3052733182907104,
"sampling/importance_sampling_ratio/mean": 0.9919667899608612,
"sampling/importance_sampling_ratio/min": 0.13297515213489533,
"sampling/sampling_logp_difference/max": 0.8991382598876954,
"sampling/sampling_logp_difference/mean": 0.003966639423742891,
"step": 9560,
"step_time": 7.2316174821928145
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1120.3,
"completions/max_terminated_length": 814.9,
"completions/mean_length": 144.45390625,
"completions/mean_terminated_length": 136.28828887939454,
"completions/min_length": 60.2,
"completions/min_terminated_length": 60.2,
"entropy": 0.03560461034066975,
"epoch": 20.492505353319057,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 9.0431e-06,
"loss": -0.0049,
"num_tokens": 968761287.0,
"reward": 1.0464843928813934,
"reward_std": 0.17021019905805587,
"rewards/reward_accuracy/mean": 0.946875,
"rewards/reward_accuracy/std": 0.1689096987247467,
"rewards/reward_format/mean": 0.09960937649011611,
"rewards/reward_format/std": 0.003647996485233307,
"sampling/importance_sampling_ratio/max": 2.424926590919495,
"sampling/importance_sampling_ratio/mean": 1.002774167060852,
"sampling/importance_sampling_ratio/min": 0.13166978284716607,
"sampling/sampling_logp_difference/max": 0.9319976568222046,
"sampling/sampling_logp_difference/mean": 0.0036593012977391482,
"step": 9570,
"step_time": 5.484637943896814
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1162.2,
"completions/max_terminated_length": 987.6,
"completions/mean_length": 150.594140625,
"completions/mean_terminated_length": 147.63726806640625,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.038895694306120276,
"epoch": 20.51391862955032,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.1953125,
"learning_rate": 9.042100000000001e-06,
"loss": -0.0035,
"num_tokens": 969668376.0,
"reward": 1.0607812762260438,
"reward_std": 0.17169202417135238,
"rewards/reward_accuracy/mean": 0.9609375,
"rewards/reward_accuracy/std": 0.1709093615412712,
"rewards/reward_format/mean": 0.09984375163912773,
"rewards/reward_format/std": 0.0021321487613022326,
"sampling/importance_sampling_ratio/max": 2.414518451690674,
"sampling/importance_sampling_ratio/mean": 0.9797936797142028,
"sampling/importance_sampling_ratio/min": 0.11580306440591812,
"sampling/sampling_logp_difference/max": 1.0255807101726533,
"sampling/sampling_logp_difference/mean": 0.003857136028818786,
"step": 9580,
"step_time": 5.66196625471639
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1039.5,
"completions/max_terminated_length": 883.3,
"completions/mean_length": 145.096875,
"completions/mean_terminated_length": 143.61675872802735,
"completions/min_length": 70.8,
"completions/min_terminated_length": 70.8,
"entropy": 0.0377669254085049,
"epoch": 20.535331905781586,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.77734375,
"learning_rate": 9.0411e-06,
"loss": -0.0019,
"num_tokens": 970558560.0,
"reward": 1.0678711175918578,
"reward_std": 0.1361901968717575,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.13592282608151435,
"rewards/reward_format/mean": 0.09990234524011612,
"rewards/reward_format/std": 0.0013226743321865797,
"sampling/importance_sampling_ratio/max": 2.664250707626343,
"sampling/importance_sampling_ratio/mean": 0.987525737285614,
"sampling/importance_sampling_ratio/min": 0.14369155764579772,
"sampling/sampling_logp_difference/max": 0.9430588483810425,
"sampling/sampling_logp_difference/mean": 0.004035376431420446,
"step": 9590,
"step_time": 5.129275070794392
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1809.9,
"completions/max_terminated_length": 1666.5,
"completions/mean_length": 182.725390625,
"completions/mean_terminated_length": 170.40856475830077,
"completions/min_length": 70.7,
"completions/min_terminated_length": 70.7,
"entropy": 0.053642172808758916,
"epoch": 20.556745182012847,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.4453125,
"learning_rate": 9.0401e-06,
"loss": -0.0043,
"num_tokens": 971548161.0,
"reward": 1.0553320467472076,
"reward_std": 0.18020469099283218,
"rewards/reward_accuracy/mean": 0.955859375,
"rewards/reward_accuracy/std": 0.17768767476081848,
"rewards/reward_format/mean": 0.09947265684604645,
"rewards/reward_format/std": 0.005646963207982481,
"sampling/importance_sampling_ratio/max": 2.5940897941589354,
"sampling/importance_sampling_ratio/mean": 0.9909974813461304,
"sampling/importance_sampling_ratio/min": 0.06359823122620582,
"sampling/sampling_logp_difference/max": 1.0154323756694794,
"sampling/sampling_logp_difference/mean": 0.0043914541602134705,
"step": 9600,
"step_time": 8.894105171004776
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1375.3,
"completions/max_terminated_length": 1183.1,
"completions/mean_length": 162.6890625,
"completions/mean_terminated_length": 150.90655212402345,
"completions/min_length": 62.4,
"completions/min_terminated_length": 62.4,
"entropy": 0.04833602337166667,
"epoch": 20.57815845824411,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.265625,
"learning_rate": 9.039100000000001e-06,
"loss": -0.0022,
"num_tokens": 972481589.0,
"reward": 1.0616015791893005,
"reward_std": 0.17988139986991883,
"rewards/reward_accuracy/mean": 0.962109375,
"rewards/reward_accuracy/std": 0.17765865176916124,
"rewards/reward_format/mean": 0.09949218854308128,
"rewards/reward_format/std": 0.004105528281070292,
"sampling/importance_sampling_ratio/max": 2.3189747810363768,
"sampling/importance_sampling_ratio/mean": 0.9875748634338379,
"sampling/importance_sampling_ratio/min": 0.10970372408628463,
"sampling/sampling_logp_difference/max": 1.0241555273532867,
"sampling/sampling_logp_difference/mean": 0.004224461130797863,
"step": 9610,
"step_time": 6.5861921827861805
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1572.9,
"completions/max_terminated_length": 1044.6,
"completions/mean_length": 152.906640625,
"completions/mean_terminated_length": 143.9917739868164,
"completions/min_length": 65.2,
"completions/min_terminated_length": 65.2,
"entropy": 0.04302301805000752,
"epoch": 20.599571734475376,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.349609375,
"learning_rate": 9.0381e-06,
"loss": -0.0025,
"num_tokens": 973388790.0,
"reward": 1.0804101705551148,
"reward_std": 0.11797500848770141,
"rewards/reward_accuracy/mean": 0.980859375,
"rewards/reward_accuracy/std": 0.11523856520652771,
"rewards/reward_format/mean": 0.09955078214406968,
"rewards/reward_format/std": 0.004707336518913507,
"sampling/importance_sampling_ratio/max": 2.506846570968628,
"sampling/importance_sampling_ratio/mean": 0.9925802171230316,
"sampling/importance_sampling_ratio/min": 0.1756427839398384,
"sampling/sampling_logp_difference/max": 0.9028515815734863,
"sampling/sampling_logp_difference/mean": 0.0036673703929409386,
"step": 9620,
"step_time": 7.540604859325685
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1117.1,
"completions/max_terminated_length": 1098.9,
"completions/mean_length": 149.988671875,
"completions/mean_terminated_length": 148.51215667724608,
"completions/min_length": 67.5,
"completions/min_terminated_length": 67.5,
"entropy": 0.04244908476248384,
"epoch": 20.620985010706637,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.5078125,
"learning_rate": 9.0371e-06,
"loss": -0.0107,
"num_tokens": 974288921.0,
"reward": 1.0643164217472076,
"reward_std": 0.15300461798906326,
"rewards/reward_accuracy/mean": 0.964453125,
"rewards/reward_accuracy/std": 0.1519756942987442,
"rewards/reward_format/mean": 0.09986328184604645,
"rewards/reward_format/std": 0.0017637486103922128,
"sampling/importance_sampling_ratio/max": 2.528737246990204,
"sampling/importance_sampling_ratio/mean": 0.9969575226306915,
"sampling/importance_sampling_ratio/min": 0.15285894125699998,
"sampling/sampling_logp_difference/max": 0.9588941931724548,
"sampling/sampling_logp_difference/mean": 0.0038899104576557873,
"step": 9630,
"step_time": 5.495048817808856
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1599.3,
"completions/max_terminated_length": 1175.9,
"completions/mean_length": 162.471875,
"completions/mean_terminated_length": 148.4839660644531,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.04316717623732984,
"epoch": 20.6423982869379,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.6171875,
"learning_rate": 9.036100000000001e-06,
"loss": -0.0068,
"num_tokens": 975225105.0,
"reward": 1.0365625202655793,
"reward_std": 0.22556758150458336,
"rewards/reward_accuracy/mean": 0.937109375,
"rewards/reward_accuracy/std": 0.22396075800061227,
"rewards/reward_format/mean": 0.09945312663912773,
"rewards/reward_format/std": 0.0033678514882922173,
"sampling/importance_sampling_ratio/max": 2.445440649986267,
"sampling/importance_sampling_ratio/mean": 0.9849195420742035,
"sampling/importance_sampling_ratio/min": 0.059182215947657824,
"sampling/sampling_logp_difference/max": 0.9232854008674621,
"sampling/sampling_logp_difference/mean": 0.004047739575617016,
"step": 9640,
"step_time": 7.531236869218992
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1033.5,
"completions/max_terminated_length": 1008.3,
"completions/mean_length": 155.96328125,
"completions/mean_terminated_length": 150.83581085205077,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.0430231248261407,
"epoch": 20.663811563169165,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.380859375,
"learning_rate": 9.035100000000001e-06,
"loss": -0.0083,
"num_tokens": 976139811.0,
"reward": 1.0767773628234862,
"reward_std": 0.12199952378869057,
"rewards/reward_accuracy/mean": 0.976953125,
"rewards/reward_accuracy/std": 0.1211847223341465,
"rewards/reward_format/mean": 0.0998242199420929,
"rewards/reward_format/std": 0.001561674429103732,
"sampling/importance_sampling_ratio/max": 2.590941572189331,
"sampling/importance_sampling_ratio/mean": 0.9813974022865295,
"sampling/importance_sampling_ratio/min": 0.14192537926137447,
"sampling/sampling_logp_difference/max": 1.032774603366852,
"sampling/sampling_logp_difference/mean": 0.0042243595235049725,
"step": 9650,
"step_time": 5.356963308583363
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1584.2,
"completions/max_terminated_length": 1284.8,
"completions/mean_length": 159.35546875,
"completions/mean_terminated_length": 151.33111572265625,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.044019264774397014,
"epoch": 20.68522483940043,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.3046875,
"learning_rate": 9.0341e-06,
"loss": -0.0053,
"num_tokens": 977074657.0,
"reward": 1.0841211080551147,
"reward_std": 0.10273950323462486,
"rewards/reward_accuracy/mean": 0.984375,
"rewards/reward_accuracy/std": 0.10152760595083236,
"rewards/reward_format/mean": 0.09974609389901161,
"rewards/reward_format/std": 0.0023240381153300403,
"sampling/importance_sampling_ratio/max": 2.499576950073242,
"sampling/importance_sampling_ratio/mean": 0.97985959649086,
"sampling/importance_sampling_ratio/min": 0.15460203476250173,
"sampling/sampling_logp_difference/max": 0.9114595890045166,
"sampling/sampling_logp_difference/mean": 0.004188334150239825,
"step": 9660,
"step_time": 7.479745704794186
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1285.6,
"completions/max_terminated_length": 1209.7,
"completions/mean_length": 164.491796875,
"completions/mean_terminated_length": 154.96204376220703,
"completions/min_length": 68.4,
"completions/min_terminated_length": 68.4,
"entropy": 0.04392874310724437,
"epoch": 20.70663811563169,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.142578125,
"learning_rate": 9.0331e-06,
"loss": -0.0064,
"num_tokens": 978015084.0,
"reward": 1.0679296970367431,
"reward_std": 0.14715766832232474,
"rewards/reward_accuracy/mean": 0.968359375,
"rewards/reward_accuracy/std": 0.14547782018780708,
"rewards/reward_format/mean": 0.09957031309604644,
"rewards/reward_format/std": 0.004024181980639696,
"sampling/importance_sampling_ratio/max": 2.5143630027771,
"sampling/importance_sampling_ratio/mean": 0.9914460420608521,
"sampling/importance_sampling_ratio/min": 0.1520752776414156,
"sampling/sampling_logp_difference/max": 0.8152877390384674,
"sampling/sampling_logp_difference/mean": 0.0038756511174142362,
"step": 9670,
"step_time": 6.446495631281868
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1566.1,
"completions/max_terminated_length": 1256.9,
"completions/mean_length": 160.874609375,
"completions/mean_terminated_length": 153.54659576416014,
"completions/min_length": 61.6,
"completions/min_terminated_length": 61.6,
"entropy": 0.04650077945552766,
"epoch": 20.728051391862955,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.2578125,
"learning_rate": 9.032100000000001e-06,
"loss": -0.0089,
"num_tokens": 978945499.0,
"reward": 1.0586719036102294,
"reward_std": 0.18684569224715233,
"rewards/reward_accuracy/mean": 0.958984375,
"rewards/reward_accuracy/std": 0.18510170057415962,
"rewards/reward_format/mean": 0.09968750178813934,
"rewards/reward_format/std": 0.0036580686923116446,
"sampling/importance_sampling_ratio/max": 2.491647815704346,
"sampling/importance_sampling_ratio/mean": 0.9952693581581116,
"sampling/importance_sampling_ratio/min": 0.15194832682609558,
"sampling/sampling_logp_difference/max": 0.943127453327179,
"sampling/sampling_logp_difference/mean": 0.004126214678399265,
"step": 9680,
"step_time": 7.410320304695051
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1592.9,
"completions/max_terminated_length": 1503.2,
"completions/mean_length": 162.18125,
"completions/mean_terminated_length": 153.35069427490234,
"completions/min_length": 69.8,
"completions/min_terminated_length": 69.8,
"entropy": 0.044413124793209136,
"epoch": 20.74946466809422,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.138671875,
"learning_rate": 9.0311e-06,
"loss": -0.0062,
"num_tokens": 979877819.0,
"reward": 1.0625390887260437,
"reward_std": 0.14572153612971306,
"rewards/reward_accuracy/mean": 0.962890625,
"rewards/reward_accuracy/std": 0.14404306709766387,
"rewards/reward_format/mean": 0.09964843913912773,
"rewards/reward_format/std": 0.0035619751550257208,
"sampling/importance_sampling_ratio/max": 2.5800753593444825,
"sampling/importance_sampling_ratio/mean": 0.9806273400783538,
"sampling/importance_sampling_ratio/min": 0.08983311057090759,
"sampling/sampling_logp_difference/max": 1.1474958062171936,
"sampling/sampling_logp_difference/mean": 0.0041600283002480865,
"step": 9690,
"step_time": 7.412665121484315
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1044.6,
"completions/max_terminated_length": 835.6,
"completions/mean_length": 155.457421875,
"completions/mean_terminated_length": 150.31749114990234,
"completions/min_length": 70.1,
"completions/min_terminated_length": 70.1,
"entropy": 0.039094252581708136,
"epoch": 20.77087794432548,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.380859375,
"learning_rate": 9.0301e-06,
"loss": -0.0044,
"num_tokens": 980793902.0,
"reward": 1.0701953291893005,
"reward_std": 0.12001206129789352,
"rewards/reward_accuracy/mean": 0.9703125,
"rewards/reward_accuracy/std": 0.11952262967824936,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.0016351743834093213,
"sampling/importance_sampling_ratio/max": 2.4467029929161073,
"sampling/importance_sampling_ratio/mean": 0.9916735470294953,
"sampling/importance_sampling_ratio/min": 0.1720254361629486,
"sampling/sampling_logp_difference/max": 1.0808980941772461,
"sampling/sampling_logp_difference/mean": 0.003963481797836721,
"step": 9700,
"step_time": 5.322770311488421
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1288.1,
"completions/max_terminated_length": 1023.0,
"completions/mean_length": 157.914453125,
"completions/mean_terminated_length": 152.7582244873047,
"completions/min_length": 62.2,
"completions/min_terminated_length": 62.2,
"entropy": 0.04323129947297275,
"epoch": 20.792291220556745,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.51953125,
"learning_rate": 9.029100000000001e-06,
"loss": 0.0015,
"num_tokens": 981722931.0,
"reward": 1.062968772649765,
"reward_std": 0.13316667079925537,
"rewards/reward_accuracy/mean": 0.96328125,
"rewards/reward_accuracy/std": 0.13129849433898927,
"rewards/reward_format/mean": 0.09968750178813934,
"rewards/reward_format/std": 0.0033178773475810884,
"sampling/importance_sampling_ratio/max": 2.5903496503829957,
"sampling/importance_sampling_ratio/mean": 0.9893921434879303,
"sampling/importance_sampling_ratio/min": 0.09304811730980873,
"sampling/sampling_logp_difference/max": 1.1986364603042603,
"sampling/sampling_logp_difference/mean": 0.004243611195124686,
"step": 9710,
"step_time": 6.205364897189429
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1263.3,
"completions/max_terminated_length": 940.6,
"completions/mean_length": 142.426171875,
"completions/mean_terminated_length": 138.01132583618164,
"completions/min_length": 62.7,
"completions/min_terminated_length": 62.7,
"entropy": 0.03808842154685408,
"epoch": 20.81370449678801,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.412109375,
"learning_rate": 9.028100000000001e-06,
"loss": -0.0058,
"num_tokens": 982596214.0,
"reward": 1.0813086032867432,
"reward_std": 0.09150040224194526,
"rewards/reward_accuracy/mean": 0.981640625,
"rewards/reward_accuracy/std": 0.08916686773300171,
"rewards/reward_format/mean": 0.09966796934604645,
"rewards/reward_format/std": 0.0035525617422536016,
"sampling/importance_sampling_ratio/max": 2.333670771121979,
"sampling/importance_sampling_ratio/mean": 0.9830051362514496,
"sampling/importance_sampling_ratio/min": 0.14152817614376545,
"sampling/sampling_logp_difference/max": 0.9653074264526367,
"sampling/sampling_logp_difference/mean": 0.003815475688315928,
"step": 9720,
"step_time": 6.050054537600954
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1294.9,
"completions/max_terminated_length": 1007.3,
"completions/mean_length": 144.51484375,
"completions/mean_terminated_length": 140.78505783081056,
"completions/min_length": 61.1,
"completions/min_terminated_length": 61.1,
"entropy": 0.035224367235787216,
"epoch": 20.83511777301927,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.12255859375,
"learning_rate": 9.0271e-06,
"loss": -0.0087,
"num_tokens": 983485420.0,
"reward": 1.0748633027076722,
"reward_std": 0.12583040595054626,
"rewards/reward_accuracy/mean": 0.975,
"rewards/reward_accuracy/std": 0.12447099462151527,
"rewards/reward_format/mean": 0.09986328259110451,
"rewards/reward_format/std": 0.0019476743880659341,
"sampling/importance_sampling_ratio/max": 2.5276031494140625,
"sampling/importance_sampling_ratio/mean": 0.9935354888439178,
"sampling/importance_sampling_ratio/min": 0.2223975643515587,
"sampling/sampling_logp_difference/max": 0.9208126544952393,
"sampling/sampling_logp_difference/mean": 0.003818971640430391,
"step": 9730,
"step_time": 6.12570981439203
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1383.9,
"completions/max_terminated_length": 1314.4,
"completions/mean_length": 176.13515625,
"completions/mean_terminated_length": 168.96027069091798,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.04436691864393651,
"epoch": 20.856531049250535,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.251953125,
"learning_rate": 9.026100000000002e-06,
"loss": -0.0046,
"num_tokens": 984459078.0,
"reward": 1.0519336104393004,
"reward_std": 0.17122509479522705,
"rewards/reward_accuracy/mean": 0.95234375,
"rewards/reward_accuracy/std": 0.1693316951394081,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.00390720043797046,
"sampling/importance_sampling_ratio/max": 2.323023092746735,
"sampling/importance_sampling_ratio/mean": 0.9793604016304016,
"sampling/importance_sampling_ratio/min": 0.15131007358431817,
"sampling/sampling_logp_difference/max": 1.0446141839027405,
"sampling/sampling_logp_difference/mean": 0.003908500191755593,
"step": 9740,
"step_time": 6.889585492914193
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.7478150766692124e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.7478150766692124e-06,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1369.1,
"completions/max_terminated_length": 1226.5,
"completions/mean_length": 176.953515625,
"completions/mean_terminated_length": 157.72741088867187,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.04859364067669958,
"epoch": 20.8779443254818,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.328125,
"learning_rate": 9.025100000000001e-06,
"loss": 0.0005,
"num_tokens": 985429807.0,
"reward": 1.0569726705551148,
"reward_std": 0.17324335724115372,
"rewards/reward_accuracy/mean": 0.9578125,
"rewards/reward_accuracy/std": 0.1700064495205879,
"rewards/reward_format/mean": 0.09916015639901161,
"rewards/reward_format/std": 0.005222068983130157,
"sampling/importance_sampling_ratio/max": 2.617575454711914,
"sampling/importance_sampling_ratio/mean": 0.9962279379367829,
"sampling/importance_sampling_ratio/min": 0.002961219847202301,
"sampling/sampling_logp_difference/max": 1.1075387716293335,
"sampling/sampling_logp_difference/mean": 0.004247820563614368,
"step": 9750,
"step_time": 6.9591904614120725
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012109375,
"completions/max_length": 1959.2,
"completions/max_terminated_length": 1793.6,
"completions/mean_length": 205.8,
"completions/mean_terminated_length": 183.41503295898437,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.05511588896624744,
"epoch": 20.899357601713064,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.384765625,
"learning_rate": 9.0241e-06,
"loss": -0.0177,
"num_tokens": 986478911.0,
"reward": 1.0416211187839508,
"reward_std": 0.22274344637989998,
"rewards/reward_accuracy/mean": 0.942578125,
"rewards/reward_accuracy/std": 0.21956978738307953,
"rewards/reward_format/mean": 0.09904297068715096,
"rewards/reward_format/std": 0.00648826512042433,
"sampling/importance_sampling_ratio/max": 2.7059046745300295,
"sampling/importance_sampling_ratio/mean": 0.983485347032547,
"sampling/importance_sampling_ratio/min": 0.08402718212455511,
"sampling/sampling_logp_difference/max": 1.0544158697128296,
"sampling/sampling_logp_difference/mean": 0.004393012565560639,
"step": 9760,
"step_time": 9.659973237593658
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1354.8,
"completions/max_terminated_length": 948.5,
"completions/mean_length": 174.3578125,
"completions/mean_terminated_length": 161.46367950439452,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.04631093223579228,
"epoch": 20.920770877944324,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.546875,
"learning_rate": 9.0231e-06,
"loss": -0.0019,
"num_tokens": 987448083.0,
"reward": 1.0490625202655792,
"reward_std": 0.16510942578315735,
"rewards/reward_accuracy/mean": 0.949609375,
"rewards/reward_accuracy/std": 0.16344898864626883,
"rewards/reward_format/mean": 0.09945312514901161,
"rewards/reward_format/std": 0.004331236216239631,
"sampling/importance_sampling_ratio/max": 2.5576298236846924,
"sampling/importance_sampling_ratio/mean": 0.9851946413516999,
"sampling/importance_sampling_ratio/min": 0.10638822317123413,
"sampling/sampling_logp_difference/max": 1.0302805185317994,
"sampling/sampling_logp_difference/mean": 0.004025372769683599,
"step": 9770,
"step_time": 6.8756098900834335
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1147.4,
"completions/max_terminated_length": 1063.5,
"completions/mean_length": 166.91171875,
"completions/mean_terminated_length": 154.4723159790039,
"completions/min_length": 66.5,
"completions/min_terminated_length": 66.5,
"entropy": 0.04943813912104815,
"epoch": 20.94218415417559,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.53125,
"learning_rate": 9.0221e-06,
"loss": -0.0027,
"num_tokens": 988393857.0,
"reward": 1.0729883074760438,
"reward_std": 0.13370950445532798,
"rewards/reward_accuracy/mean": 0.9734375,
"rewards/reward_accuracy/std": 0.13195253610610963,
"rewards/reward_format/mean": 0.09955078363418579,
"rewards/reward_format/std": 0.0034094065660610793,
"sampling/importance_sampling_ratio/max": 2.579384684562683,
"sampling/importance_sampling_ratio/mean": 0.9793617725372314,
"sampling/importance_sampling_ratio/min": 0.13200344685465099,
"sampling/sampling_logp_difference/max": 1.0394632935523986,
"sampling/sampling_logp_difference/mean": 0.004341482813470065,
"step": 9780,
"step_time": 5.9173060599947345
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1184.1,
"completions/max_terminated_length": 885.6,
"completions/mean_length": 154.364453125,
"completions/mean_terminated_length": 145.62998046875,
"completions/min_length": 66.5,
"completions/min_terminated_length": 66.5,
"entropy": 0.038829141203314065,
"epoch": 20.963597430406853,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 9.0211e-06,
"loss": 0.0004,
"num_tokens": 989304054.0,
"reward": 1.0706250071525574,
"reward_std": 0.13846353441476822,
"rewards/reward_accuracy/mean": 0.97109375,
"rewards/reward_accuracy/std": 0.1364782728254795,
"rewards/reward_format/mean": 0.09953125044703484,
"rewards/reward_format/std": 0.0031400542240589855,
"sampling/importance_sampling_ratio/max": 2.5277611017227173,
"sampling/importance_sampling_ratio/mean": 0.9899797677993775,
"sampling/importance_sampling_ratio/min": 0.14544751197099687,
"sampling/sampling_logp_difference/max": 0.9243818759918213,
"sampling/sampling_logp_difference/mean": 0.003741826210170984,
"step": 9790,
"step_time": 5.843484438513405
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 869.4,
"completions/max_terminated_length": 837.8,
"completions/mean_length": 148.33046875,
"completions/mean_terminated_length": 146.1214385986328,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.03749716617166996,
"epoch": 20.985010706638114,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.25390625,
"learning_rate": 9.0201e-06,
"loss": -0.0029,
"num_tokens": 990202980.0,
"reward": 1.0752930045127869,
"reward_std": 0.09974350333213806,
"rewards/reward_accuracy/mean": 0.975390625,
"rewards/reward_accuracy/std": 0.09918476343154907,
"rewards/reward_format/mean": 0.09990234524011612,
"rewards/reward_format/std": 0.001194648747332394,
"sampling/importance_sampling_ratio/max": 2.3343748927116392,
"sampling/importance_sampling_ratio/mean": 0.9873350858688354,
"sampling/importance_sampling_ratio/min": 0.15818992629647255,
"sampling/sampling_logp_difference/max": 1.127863609790802,
"sampling/sampling_logp_difference/mean": 0.003941187867894769,
"step": 9800,
"step_time": 4.404747171964845
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1738.7,
"completions/max_terminated_length": 1478.1,
"completions/mean_length": 174.4625,
"completions/mean_terminated_length": 159.0642532348633,
"completions/min_length": 71.1,
"completions/min_terminated_length": 71.1,
"entropy": 0.05055987681262195,
"epoch": 21.00642398286938,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.43359375,
"learning_rate": 9.019100000000001e-06,
"loss": -0.0026,
"num_tokens": 991174372.0,
"reward": 1.0567187547683716,
"reward_std": 0.16663419753313063,
"rewards/reward_accuracy/mean": 0.957421875,
"rewards/reward_accuracy/std": 0.16302213817834854,
"rewards/reward_format/mean": 0.09929687678813934,
"rewards/reward_format/std": 0.006453974009491503,
"sampling/importance_sampling_ratio/max": 2.4396588802337646,
"sampling/importance_sampling_ratio/mean": 0.982292652130127,
"sampling/importance_sampling_ratio/min": 0.08522241860628128,
"sampling/sampling_logp_difference/max": 1.0414207458496094,
"sampling/sampling_logp_difference/mean": 0.004380066459998488,
"step": 9810,
"step_time": 8.513658161790227
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1373.1,
"completions/max_terminated_length": 1136.0,
"completions/mean_length": 164.276171875,
"completions/mean_terminated_length": 159.9107650756836,
"completions/min_length": 67.8,
"completions/min_terminated_length": 67.8,
"entropy": 0.04701744669582695,
"epoch": 21.027837259100643,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.228515625,
"learning_rate": 9.018100000000001e-06,
"loss": -0.0028,
"num_tokens": 992113335.0,
"reward": 1.056835949420929,
"reward_std": 0.15349877402186393,
"rewards/reward_accuracy/mean": 0.95703125,
"rewards/reward_accuracy/std": 0.1522693566977978,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.0019669008674100042,
"sampling/importance_sampling_ratio/max": 2.426257538795471,
"sampling/importance_sampling_ratio/mean": 0.9850066304206848,
"sampling/importance_sampling_ratio/min": 0.1758318692445755,
"sampling/sampling_logp_difference/max": 1.0736373662948608,
"sampling/sampling_logp_difference/mean": 0.004229947179555893,
"step": 9820,
"step_time": 6.463741266704164
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.1338955320970855e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.1338955320970855e-06,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1530.4,
"completions/max_terminated_length": 1207.6,
"completions/mean_length": 168.70234375,
"completions/mean_terminated_length": 157.64132385253907,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.047793525364249946,
"epoch": 21.049250535331907,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.203125,
"learning_rate": 9.0171e-06,
"loss": -0.0073,
"num_tokens": 993065533.0,
"reward": 1.0570508003234864,
"reward_std": 0.1868712492287159,
"rewards/reward_accuracy/mean": 0.957421875,
"rewards/reward_accuracy/std": 0.18532659634947776,
"rewards/reward_format/mean": 0.09962890744209289,
"rewards/reward_format/std": 0.0033411763841286303,
"sampling/importance_sampling_ratio/max": 2.5320512294769286,
"sampling/importance_sampling_ratio/mean": 0.9763972282409668,
"sampling/importance_sampling_ratio/min": 0.08112120442092419,
"sampling/sampling_logp_difference/max": 0.9587885856628418,
"sampling/sampling_logp_difference/mean": 0.00420237104408443,
"step": 9830,
"step_time": 7.455792502785334
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1735.1,
"completions/max_terminated_length": 1261.3,
"completions/mean_length": 168.84296875,
"completions/mean_terminated_length": 155.5660888671875,
"completions/min_length": 65.7,
"completions/min_terminated_length": 65.7,
"entropy": 0.04778232031967491,
"epoch": 21.07066381156317,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.09765625,
"learning_rate": 9.016100000000002e-06,
"loss": -0.0068,
"num_tokens": 994010491.0,
"reward": 1.0589453339576722,
"reward_std": 0.18525472581386565,
"rewards/reward_accuracy/mean": 0.959375,
"rewards/reward_accuracy/std": 0.1834478944540024,
"rewards/reward_format/mean": 0.09957031384110451,
"rewards/reward_format/std": 0.004357935208827257,
"sampling/importance_sampling_ratio/max": 2.507946801185608,
"sampling/importance_sampling_ratio/mean": 0.9885113537311554,
"sampling/importance_sampling_ratio/min": 0.055226237140595914,
"sampling/sampling_logp_difference/max": 1.0246582865715026,
"sampling/sampling_logp_difference/mean": 0.004288655007258058,
"step": 9840,
"step_time": 8.212953078382998
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 995.3,
"completions/max_terminated_length": 762.2,
"completions/mean_length": 140.1390625,
"completions/mean_terminated_length": 138.6549514770508,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.03344025085680187,
"epoch": 21.092077087794433,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.087890625,
"learning_rate": 9.015100000000001e-06,
"loss": -0.0077,
"num_tokens": 994884783.0,
"reward": 1.0807812690734864,
"reward_std": 0.0992945484817028,
"rewards/reward_accuracy/mean": 0.980859375,
"rewards/reward_accuracy/std": 0.0988312192261219,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.0010101743275299669,
"sampling/importance_sampling_ratio/max": 2.4188273549079895,
"sampling/importance_sampling_ratio/mean": 0.9916119813919068,
"sampling/importance_sampling_ratio/min": 0.14228396601974963,
"sampling/sampling_logp_difference/max": 1.1028384685516357,
"sampling/sampling_logp_difference/mean": 0.0036935355281457307,
"step": 9850,
"step_time": 5.071327233882039
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1380.0,
"completions/max_terminated_length": 1150.8,
"completions/mean_length": 155.47421875,
"completions/mean_terminated_length": 146.76767807006837,
"completions/min_length": 62.3,
"completions/min_terminated_length": 62.3,
"entropy": 0.04623365541920066,
"epoch": 21.113490364025697,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.0,
"learning_rate": 9.0141e-06,
"loss": -0.0083,
"num_tokens": 995797981.0,
"reward": 1.0589844048023225,
"reward_std": 0.15166812688112258,
"rewards/reward_accuracy/mean": 0.959375,
"rewards/reward_accuracy/std": 0.1504116714000702,
"rewards/reward_format/mean": 0.09960937649011611,
"rewards/reward_format/std": 0.0032080565812066197,
"sampling/importance_sampling_ratio/max": 2.3939496278762817,
"sampling/importance_sampling_ratio/mean": 0.991208279132843,
"sampling/importance_sampling_ratio/min": 0.13315336406230927,
"sampling/sampling_logp_difference/max": 0.772571223974228,
"sampling/sampling_logp_difference/mean": 0.004302897374145687,
"step": 9860,
"step_time": 6.632901624988881
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1243.3,
"completions/max_terminated_length": 799.4,
"completions/mean_length": 160.13046875,
"completions/mean_terminated_length": 154.28158569335938,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.03973154686391354,
"epoch": 21.134903640256958,
"frac_reward_zero_std": 0.8875,
"grad_norm": 1.328125,
"learning_rate": 9.0131e-06,
"loss": -0.0052,
"num_tokens": 996727979.0,
"reward": 1.0587500154972076,
"reward_std": 0.15466317534446716,
"rewards/reward_accuracy/mean": 0.958984375,
"rewards/reward_accuracy/std": 0.1538652017712593,
"rewards/reward_format/mean": 0.09976562559604644,
"rewards/reward_format/std": 0.002858161088079214,
"sampling/importance_sampling_ratio/max": 2.471537709236145,
"sampling/importance_sampling_ratio/mean": 0.9863010823726654,
"sampling/importance_sampling_ratio/min": 0.1068119615316391,
"sampling/sampling_logp_difference/max": 1.0063478827476502,
"sampling/sampling_logp_difference/mean": 0.003801104868762195,
"step": 9870,
"step_time": 6.021991904987954
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1186.1,
"completions/max_terminated_length": 1039.1,
"completions/mean_length": 146.589453125,
"completions/mean_terminated_length": 143.61740264892578,
"completions/min_length": 62.7,
"completions/min_terminated_length": 62.7,
"entropy": 0.03597496948204935,
"epoch": 21.156316916488223,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.36328125,
"learning_rate": 9.0121e-06,
"loss": -0.0067,
"num_tokens": 997618320.0,
"reward": 1.037285166978836,
"reward_std": 0.20050647780299186,
"rewards/reward_accuracy/mean": 0.9375,
"rewards/reward_accuracy/std": 0.19957445859909057,
"rewards/reward_format/mean": 0.09978515729308128,
"rewards/reward_format/std": 0.002272926946170628,
"sampling/importance_sampling_ratio/max": 2.502523934841156,
"sampling/importance_sampling_ratio/mean": 0.9890759706497192,
"sampling/importance_sampling_ratio/min": 0.15407259687781333,
"sampling/sampling_logp_difference/max": 0.9549125671386719,
"sampling/sampling_logp_difference/mean": 0.003713409369811416,
"step": 9880,
"step_time": 5.739336844006902
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1662.9,
"completions/max_terminated_length": 1492.9,
"completions/mean_length": 180.923046875,
"completions/mean_terminated_length": 166.3808624267578,
"completions/min_length": 62.5,
"completions/min_terminated_length": 62.5,
"entropy": 0.04822738380171358,
"epoch": 21.177730192719487,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.5625,
"learning_rate": 9.011100000000001e-06,
"loss": -0.01,
"num_tokens": 998598907.0,
"reward": 1.0524609684944153,
"reward_std": 0.1763737380504608,
"rewards/reward_accuracy/mean": 0.953125,
"rewards/reward_accuracy/std": 0.17385634332895278,
"rewards/reward_format/mean": 0.09933593943715095,
"rewards/reward_format/std": 0.005638665845617652,
"sampling/importance_sampling_ratio/max": 2.516432690620422,
"sampling/importance_sampling_ratio/mean": 0.9787394344806671,
"sampling/importance_sampling_ratio/min": 0.06392785832285881,
"sampling/sampling_logp_difference/max": 1.0114442706108093,
"sampling/sampling_logp_difference/mean": 0.004064181866124272,
"step": 9890,
"step_time": 8.35769558349275
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1677.1,
"completions/max_terminated_length": 1529.2,
"completions/mean_length": 179.371875,
"completions/mean_terminated_length": 165.5760726928711,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"entropy": 0.05197636920493096,
"epoch": 21.199143468950748,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.66796875,
"learning_rate": 9.0101e-06,
"loss": -0.0088,
"num_tokens": 999579507.0,
"reward": 1.0348047077655793,
"reward_std": 0.21327415853738785,
"rewards/reward_accuracy/mean": 0.935546875,
"rewards/reward_accuracy/std": 0.21095686927437782,
"rewards/reward_format/mean": 0.09925781339406967,
"rewards/reward_format/std": 0.006166829774156213,
"sampling/importance_sampling_ratio/max": 2.471295785903931,
"sampling/importance_sampling_ratio/mean": 0.9879802584648132,
"sampling/importance_sampling_ratio/min": 0.08058868078514933,
"sampling/sampling_logp_difference/max": 1.3380119442939757,
"sampling/sampling_logp_difference/mean": 0.00432176252361387,
"step": 9900,
"step_time": 8.099537566909566
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1228.4,
"completions/max_terminated_length": 995.6,
"completions/mean_length": 155.709765625,
"completions/mean_terminated_length": 149.12539978027343,
"completions/min_length": 66.5,
"completions/min_terminated_length": 66.5,
"entropy": 0.04210319020785391,
"epoch": 21.220556745182012,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.6171875,
"learning_rate": 9.0091e-06,
"loss": -0.0053,
"num_tokens": 1000498988.0,
"reward": 1.0507226943969727,
"reward_std": 0.20771346762776374,
"rewards/reward_accuracy/mean": 0.951171875,
"rewards/reward_accuracy/std": 0.20545937791466712,
"rewards/reward_format/mean": 0.09955078363418579,
"rewards/reward_format/std": 0.0037833184003829958,
"sampling/importance_sampling_ratio/max": 2.4921345949172973,
"sampling/importance_sampling_ratio/mean": 0.9917483925819397,
"sampling/importance_sampling_ratio/min": 0.12389444932341576,
"sampling/sampling_logp_difference/max": 0.897965955734253,
"sampling/sampling_logp_difference/mean": 0.004052263800986111,
"step": 9910,
"step_time": 6.100807530997554
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1303.2,
"completions/max_terminated_length": 1054.0,
"completions/mean_length": 148.67109375,
"completions/mean_terminated_length": 144.9616226196289,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.04059880857821554,
"epoch": 21.241970021413277,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 9.008100000000001e-06,
"loss": -0.0082,
"num_tokens": 1001399906.0,
"reward": 1.064355492591858,
"reward_std": 0.15653302147984505,
"rewards/reward_accuracy/mean": 0.964453125,
"rewards/reward_accuracy/std": 0.1561000183224678,
"rewards/reward_format/mean": 0.09990234449505805,
"rewards/reward_format/std": 0.0013226743321865797,
"sampling/importance_sampling_ratio/max": 2.2642093777656553,
"sampling/importance_sampling_ratio/mean": 0.9824270665645599,
"sampling/importance_sampling_ratio/min": 0.03765727318823338,
"sampling/sampling_logp_difference/max": 1.2589550018310547,
"sampling/sampling_logp_difference/mean": 0.0040136478841304776,
"step": 9920,
"step_time": 6.33332619270077
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.971203502966091e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.971203502966091e-06,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1304.9,
"completions/max_terminated_length": 1016.9,
"completions/mean_length": 155.3234375,
"completions/mean_terminated_length": 138.41300048828126,
"completions/min_length": 67.5,
"completions/min_terminated_length": 67.5,
"entropy": 0.04280289961025119,
"epoch": 21.26338329764454,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 9.0071e-06,
"loss": -0.004,
"num_tokens": 1002316814.0,
"reward": 1.059921884536743,
"reward_std": 0.14825449362397194,
"rewards/reward_accuracy/mean": 0.960546875,
"rewards/reward_accuracy/std": 0.14626799002289773,
"rewards/reward_format/mean": 0.09937500059604645,
"rewards/reward_format/std": 0.0034846975933760403,
"sampling/importance_sampling_ratio/max": 2.4018102169036863,
"sampling/importance_sampling_ratio/mean": 0.9836527466773987,
"sampling/importance_sampling_ratio/min": 0.19114010632038117,
"sampling/sampling_logp_difference/max": 0.8694240570068359,
"sampling/sampling_logp_difference/mean": 0.003975698933936655,
"step": 9930,
"step_time": 6.477250498501235
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1253.2,
"completions/max_terminated_length": 923.5,
"completions/mean_length": 161.8640625,
"completions/mean_terminated_length": 150.92530670166016,
"completions/min_length": 66.4,
"completions/min_terminated_length": 66.4,
"entropy": 0.040501720388419926,
"epoch": 21.284796573875802,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.06591796875,
"learning_rate": 9.006100000000002e-06,
"loss": -0.0007,
"num_tokens": 1003258562.0,
"reward": 1.0722851753234863,
"reward_std": 0.1332975685596466,
"rewards/reward_accuracy/mean": 0.97265625,
"rewards/reward_accuracy/std": 0.13163162916898727,
"rewards/reward_format/mean": 0.09962890744209289,
"rewards/reward_format/std": 0.0033049869351089002,
"sampling/importance_sampling_ratio/max": 2.679917502403259,
"sampling/importance_sampling_ratio/mean": 1.0021744787693023,
"sampling/importance_sampling_ratio/min": 0.15510211382061243,
"sampling/sampling_logp_difference/max": 0.9826542139053345,
"sampling/sampling_logp_difference/mean": 0.003993232944048941,
"step": 9940,
"step_time": 6.371324648492736
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1311.9,
"completions/max_terminated_length": 1033.6,
"completions/mean_length": 157.547265625,
"completions/mean_terminated_length": 147.2760986328125,
"completions/min_length": 61.4,
"completions/min_terminated_length": 61.4,
"entropy": 0.04185357003007084,
"epoch": 21.306209850107066,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.384765625,
"learning_rate": 9.005100000000001e-06,
"loss": -0.0103,
"num_tokens": 1004178027.0,
"reward": 1.057793003320694,
"reward_std": 0.1503703661262989,
"rewards/reward_accuracy/mean": 0.958203125,
"rewards/reward_accuracy/std": 0.14844134077429771,
"rewards/reward_format/mean": 0.0995898462831974,
"rewards/reward_format/std": 0.00421040840446949,
"sampling/importance_sampling_ratio/max": 2.486556053161621,
"sampling/importance_sampling_ratio/mean": 0.9912855148315429,
"sampling/importance_sampling_ratio/min": 0.1216137208044529,
"sampling/sampling_logp_difference/max": 1.0011513769626617,
"sampling/sampling_logp_difference/mean": 0.0038218531524762513,
"step": 9950,
"step_time": 6.506721781595843
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1272.9,
"completions/max_terminated_length": 1081.0,
"completions/mean_length": 155.859765625,
"completions/mean_terminated_length": 144.071337890625,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.036458822642453016,
"epoch": 21.32762312633833,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0,
"learning_rate": 9.0041e-06,
"loss": 0.0001,
"num_tokens": 1005101860.0,
"reward": 1.0524219036102296,
"reward_std": 0.17540586814284326,
"rewards/reward_accuracy/mean": 0.952734375,
"rewards/reward_accuracy/std": 0.17419228330254555,
"rewards/reward_format/mean": 0.09968750178813934,
"rewards/reward_format/std": 0.0028210777789354326,
"sampling/importance_sampling_ratio/max": 2.258096992969513,
"sampling/importance_sampling_ratio/mean": 0.9873687922954559,
"sampling/importance_sampling_ratio/min": 0.15279301311820745,
"sampling/sampling_logp_difference/max": 0.9336569786071778,
"sampling/sampling_logp_difference/mean": 0.0035317132715135813,
"step": 9960,
"step_time": 6.391207308403682
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1504.3,
"completions/max_terminated_length": 1086.9,
"completions/mean_length": 161.708984375,
"completions/mean_terminated_length": 152.11532440185547,
"completions/min_length": 67.8,
"completions/min_terminated_length": 67.8,
"entropy": 0.04174451141152531,
"epoch": 21.349036402569592,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.11083984375,
"learning_rate": 9.003100000000002e-06,
"loss": -0.0108,
"num_tokens": 1006032043.0,
"reward": 1.0655859589576722,
"reward_std": 0.15160858482122422,
"rewards/reward_accuracy/mean": 0.966015625,
"rewards/reward_accuracy/std": 0.14966910406947137,
"rewards/reward_format/mean": 0.09957031384110451,
"rewards/reward_format/std": 0.003876163228414953,
"sampling/importance_sampling_ratio/max": 2.4254624962806703,
"sampling/importance_sampling_ratio/mean": 0.9894883394241333,
"sampling/importance_sampling_ratio/min": 0.09305057376623153,
"sampling/sampling_logp_difference/max": 0.8771265983581543,
"sampling/sampling_logp_difference/mean": 0.0038809570483863353,
"step": 9970,
"step_time": 7.144446702607093
},
{
"clip_ratio/high_max": 7.94281149865128e-06,
"clip_ratio/high_mean": 9.9285143733141e-07,
"clip_ratio/low_mean": 1.4286960094977985e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.421547446829209e-06,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1225.3,
"completions/max_terminated_length": 961.7,
"completions/mean_length": 154.637109375,
"completions/mean_terminated_length": 143.13592987060548,
"completions/min_length": 68.1,
"completions/min_terminated_length": 68.1,
"entropy": 0.042068583494983616,
"epoch": 21.370449678800856,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.35546875,
"learning_rate": 9.0021e-06,
"loss": 0.0017,
"num_tokens": 1006938730.0,
"reward": 1.0400000214576721,
"reward_std": 0.21244187355041505,
"rewards/reward_accuracy/mean": 0.940625,
"rewards/reward_accuracy/std": 0.2104586586356163,
"rewards/reward_format/mean": 0.09937500134110451,
"rewards/reward_format/std": 0.0028933755122125147,
"sampling/importance_sampling_ratio/max": 2.4726927518844604,
"sampling/importance_sampling_ratio/mean": 0.9852031111717224,
"sampling/importance_sampling_ratio/min": 0.12995110228657722,
"sampling/sampling_logp_difference/max": 1.16436408162117,
"sampling/sampling_logp_difference/mean": 0.004008164303377271,
"step": 9980,
"step_time": 6.125669053592719
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1021.3,
"completions/max_terminated_length": 976.5,
"completions/mean_length": 151.30390625,
"completions/mean_terminated_length": 144.69977264404298,
"completions/min_length": 65.2,
"completions/min_terminated_length": 65.2,
"entropy": 0.042168897669762374,
"epoch": 21.39186295503212,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 9.001100000000001e-06,
"loss": -0.006,
"num_tokens": 1007843124.0,
"reward": 1.0691992521286011,
"reward_std": 0.14202533587813376,
"rewards/reward_accuracy/mean": 0.96953125,
"rewards/reward_accuracy/std": 0.14063290730118752,
"rewards/reward_format/mean": 0.09966797009110451,
"rewards/reward_format/std": 0.002725073788315058,
"sampling/importance_sampling_ratio/max": 2.4579633474349976,
"sampling/importance_sampling_ratio/mean": 0.9882322251796722,
"sampling/importance_sampling_ratio/min": 0.1216510720551014,
"sampling/sampling_logp_difference/max": 1.0314219117164611,
"sampling/sampling_logp_difference/mean": 0.004154024086892605,
"step": 9990,
"step_time": 5.213499960108311
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1137.5,
"completions/max_terminated_length": 999.8,
"completions/mean_length": 155.21015625,
"completions/mean_terminated_length": 143.65365295410157,
"completions/min_length": 60.3,
"completions/min_terminated_length": 60.3,
"entropy": 0.044048744603060186,
"epoch": 21.41327623126338,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.384765625,
"learning_rate": 9.0001e-06,
"loss": -0.0025,
"num_tokens": 1008755598.0,
"reward": 1.0592773675918579,
"reward_std": 0.15503362119197844,
"rewards/reward_accuracy/mean": 0.959765625,
"rewards/reward_accuracy/std": 0.15342760980129241,
"rewards/reward_format/mean": 0.09951172024011612,
"rewards/reward_format/std": 0.0031292189145460726,
"sampling/importance_sampling_ratio/max": 2.503136658668518,
"sampling/importance_sampling_ratio/mean": 0.9787138402462006,
"sampling/importance_sampling_ratio/min": 0.15929175093770026,
"sampling/sampling_logp_difference/max": 1.061443269252777,
"sampling/sampling_logp_difference/mean": 0.004121890105307102,
"step": 10000,
"step_time": 5.902121822998742
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1791.1,
"completions/max_terminated_length": 1001.5,
"completions/mean_length": 155.22890625,
"completions/mean_terminated_length": 144.8460433959961,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.041333383927121756,
"epoch": 21.434689507494646,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.75,
"learning_rate": 8.9991e-06,
"loss": -0.0077,
"num_tokens": 1009669768.0,
"reward": 1.0571289241313935,
"reward_std": 0.18579963520169257,
"rewards/reward_accuracy/mean": 0.957421875,
"rewards/reward_accuracy/std": 0.18405614346265792,
"rewards/reward_format/mean": 0.09970703274011612,
"rewards/reward_format/std": 0.0037134200101718307,
"sampling/importance_sampling_ratio/max": 2.3626285195350647,
"sampling/importance_sampling_ratio/mean": 0.9859773337841033,
"sampling/importance_sampling_ratio/min": 0.1213980883359909,
"sampling/sampling_logp_difference/max": 0.9180263340473175,
"sampling/sampling_logp_difference/mean": 0.003957601590082049,
"step": 10010,
"step_time": 8.234654484994826
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1469.4,
"completions/max_terminated_length": 1282.3,
"completions/mean_length": 167.567578125,
"completions/mean_terminated_length": 157.99429626464843,
"completions/min_length": 65.7,
"completions/min_terminated_length": 65.7,
"entropy": 0.04337228809017688,
"epoch": 21.45610278372591,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.294921875,
"learning_rate": 8.998100000000001e-06,
"loss": -0.0078,
"num_tokens": 1010617397.0,
"reward": 1.0651171922683715,
"reward_std": 0.13552899316418915,
"rewards/reward_accuracy/mean": 0.965625,
"rewards/reward_accuracy/std": 0.13325711563229561,
"rewards/reward_format/mean": 0.09949218779802323,
"rewards/reward_format/std": 0.004316557850688696,
"sampling/importance_sampling_ratio/max": 2.4513794064521788,
"sampling/importance_sampling_ratio/mean": 0.9794568419456482,
"sampling/importance_sampling_ratio/min": 0.043712659180164336,
"sampling/sampling_logp_difference/max": 1.0406408667564393,
"sampling/sampling_logp_difference/mean": 0.0040049860952422025,
"step": 10020,
"step_time": 7.20081194518134
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1254.8,
"completions/max_terminated_length": 1037.9,
"completions/mean_length": 165.83203125,
"completions/mean_terminated_length": 149.6276611328125,
"completions/min_length": 59.9,
"completions/min_terminated_length": 59.9,
"entropy": 0.04308660053648054,
"epoch": 21.477516059957175,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.7109375,
"learning_rate": 8.9971e-06,
"loss": -0.0062,
"num_tokens": 1011559879.0,
"reward": 1.0609179854393005,
"reward_std": 0.15986548364162445,
"rewards/reward_accuracy/mean": 0.96171875,
"rewards/reward_accuracy/std": 0.1568314924836159,
"rewards/reward_format/mean": 0.09919921979308129,
"rewards/reward_format/std": 0.004170956276357174,
"sampling/importance_sampling_ratio/max": 2.547334098815918,
"sampling/importance_sampling_ratio/mean": 0.9781998693943024,
"sampling/importance_sampling_ratio/min": 0.14051836226135492,
"sampling/sampling_logp_difference/max": 0.8557088375091553,
"sampling/sampling_logp_difference/mean": 0.004009787668474018,
"step": 10030,
"step_time": 6.169823154006735
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1285.7,
"completions/max_terminated_length": 1276.8,
"completions/mean_length": 151.43984375,
"completions/mean_terminated_length": 149.23805389404296,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.03768339185044169,
"epoch": 21.498929336188436,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0,
"learning_rate": 8.9961e-06,
"loss": -0.0054,
"num_tokens": 1012462397.0,
"reward": 1.0764257788658143,
"reward_std": 0.12901996702421456,
"rewards/reward_accuracy/mean": 0.9765625,
"rewards/reward_accuracy/std": 0.1280085913836956,
"rewards/reward_format/mean": 0.09986328110098838,
"rewards/reward_format/std": 0.0019476743414998054,
"sampling/importance_sampling_ratio/max": 2.5242197036743166,
"sampling/importance_sampling_ratio/mean": 0.9817956984043121,
"sampling/importance_sampling_ratio/min": 0.0890330221503973,
"sampling/sampling_logp_difference/max": 0.9874495148658753,
"sampling/sampling_logp_difference/mean": 0.003681789757683873,
"step": 10040,
"step_time": 6.191938539102557
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.783293141168542e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.783293141168542e-06,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1019.5,
"completions/max_terminated_length": 697.8,
"completions/mean_length": 143.72890625,
"completions/mean_terminated_length": 140.78467864990233,
"completions/min_length": 63.1,
"completions/min_terminated_length": 63.1,
"entropy": 0.03513142671436072,
"epoch": 21.5203426124197,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.995100000000001e-06,
"loss": -0.0033,
"num_tokens": 1013348471.0,
"reward": 1.0857812643051148,
"reward_std": 0.08222082927823067,
"rewards/reward_accuracy/mean": 0.9859375,
"rewards/reward_accuracy/std": 0.0813312478363514,
"rewards/reward_format/mean": 0.09984375089406967,
"rewards/reward_format/std": 0.0018717264058068395,
"sampling/importance_sampling_ratio/max": 2.5509865045547486,
"sampling/importance_sampling_ratio/mean": 0.98524711728096,
"sampling/importance_sampling_ratio/min": 0.1849169809371233,
"sampling/sampling_logp_difference/max": 0.9524425089359283,
"sampling/sampling_logp_difference/mean": 0.003714151564054191,
"step": 10050,
"step_time": 4.93670785970171
},
{
"clip_ratio/high_max": 2.711986089707352e-05,
"clip_ratio/high_mean": 3.38998261213419e-06,
"clip_ratio/low_mean": 9.282450491809868e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.3182276613151774e-06,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1261.4,
"completions/max_terminated_length": 1012.6,
"completions/mean_length": 157.142578125,
"completions/mean_terminated_length": 143.6817481994629,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.04224957309197634,
"epoch": 21.541755888650965,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.9941e-06,
"loss": 0.0023,
"num_tokens": 1014263492.0,
"reward": 1.0612109422683715,
"reward_std": 0.16772859618067743,
"rewards/reward_accuracy/mean": 0.96171875,
"rewards/reward_accuracy/std": 0.16595625057816504,
"rewards/reward_format/mean": 0.09949218779802323,
"rewards/reward_format/std": 0.0030979134142398836,
"sampling/importance_sampling_ratio/max": 2.4310709834098816,
"sampling/importance_sampling_ratio/mean": 0.9852040112018585,
"sampling/importance_sampling_ratio/min": 0.12419422259554266,
"sampling/sampling_logp_difference/max": 1.0125086545944213,
"sampling/sampling_logp_difference/mean": 0.003889014571905136,
"step": 10060,
"step_time": 6.438402519701048
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1502.3,
"completions/max_terminated_length": 1046.9,
"completions/mean_length": 162.0859375,
"completions/mean_terminated_length": 152.56519622802733,
"completions/min_length": 68.7,
"completions/min_terminated_length": 68.7,
"entropy": 0.04040030920878053,
"epoch": 21.563169164882225,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.5859375,
"learning_rate": 8.993100000000002e-06,
"loss": -0.0143,
"num_tokens": 1015190304.0,
"reward": 1.071484386920929,
"reward_std": 0.13377708941698074,
"rewards/reward_accuracy/mean": 0.971875,
"rewards/reward_accuracy/std": 0.13225097507238387,
"rewards/reward_format/mean": 0.09960937574505806,
"rewards/reward_format/std": 0.003647996531799436,
"sampling/importance_sampling_ratio/max": 2.4993433952331543,
"sampling/importance_sampling_ratio/mean": 0.9915861546993255,
"sampling/importance_sampling_ratio/min": 0.08933223895728588,
"sampling/sampling_logp_difference/max": 1.0642663478851317,
"sampling/sampling_logp_difference/mean": 0.0039754330413416025,
"step": 10070,
"step_time": 7.119071475011879
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1128.6,
"completions/max_terminated_length": 938.2,
"completions/mean_length": 159.85078125,
"completions/mean_terminated_length": 153.26780395507814,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.04471788306254894,
"epoch": 21.58458244111349,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.5390625,
"learning_rate": 8.9921e-06,
"loss": -0.0071,
"num_tokens": 1016118226.0,
"reward": 1.0824023723602294,
"reward_std": 0.10512687414884567,
"rewards/reward_accuracy/mean": 0.9828125,
"rewards/reward_accuracy/std": 0.10282080173492432,
"rewards/reward_format/mean": 0.09958984553813935,
"rewards/reward_format/std": 0.0035066165030002592,
"sampling/importance_sampling_ratio/max": 2.511189806461334,
"sampling/importance_sampling_ratio/mean": 0.9909968674182892,
"sampling/importance_sampling_ratio/min": 0.13322984278202057,
"sampling/sampling_logp_difference/max": 0.9516285598278046,
"sampling/sampling_logp_difference/mean": 0.004244732297956943,
"step": 10080,
"step_time": 5.73660954630468
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 937.1,
"completions/max_terminated_length": 756.8,
"completions/mean_length": 146.773828125,
"completions/mean_terminated_length": 145.2721206665039,
"completions/min_length": 63.1,
"completions/min_terminated_length": 63.1,
"entropy": 0.03517711136955768,
"epoch": 21.605995717344754,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.2470703125,
"learning_rate": 8.991100000000001e-06,
"loss": -0.0074,
"num_tokens": 1017013023.0,
"reward": 1.0756445527076721,
"reward_std": 0.118829046189785,
"rewards/reward_accuracy/mean": 0.97578125,
"rewards/reward_accuracy/std": 0.11821696981787681,
"rewards/reward_format/mean": 0.09986328259110451,
"rewards/reward_format/std": 0.001635723072104156,
"sampling/importance_sampling_ratio/max": 2.4854249954223633,
"sampling/importance_sampling_ratio/mean": 0.9871014714241028,
"sampling/importance_sampling_ratio/min": 0.14303154051303862,
"sampling/sampling_logp_difference/max": 1.0085016131401061,
"sampling/sampling_logp_difference/mean": 0.0037257127230986955,
"step": 10090,
"step_time": 4.755542461996083
},
{
"clip_ratio/high_max": 1.90781443961896e-05,
"clip_ratio/high_mean": 2.3847680495237e-06,
"clip_ratio/low_mean": 2.444552501401631e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.829320550925331e-06,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1514.6,
"completions/max_terminated_length": 1163.9,
"completions/mean_length": 165.441015625,
"completions/mean_terminated_length": 152.14153900146485,
"completions/min_length": 67.2,
"completions/min_terminated_length": 67.2,
"entropy": 0.04346627099439502,
"epoch": 21.62740899357602,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.283203125,
"learning_rate": 8.9901e-06,
"loss": -0.0028,
"num_tokens": 1017957192.0,
"reward": 1.0783984541893006,
"reward_std": 0.10657487958669662,
"rewards/reward_accuracy/mean": 0.97890625,
"rewards/reward_accuracy/std": 0.10388406291604042,
"rewards/reward_format/mean": 0.09949218854308128,
"rewards/reward_format/std": 0.004105528281070292,
"sampling/importance_sampling_ratio/max": 2.5568832993507384,
"sampling/importance_sampling_ratio/mean": 0.9876145601272583,
"sampling/importance_sampling_ratio/min": 0.1765353510156274,
"sampling/sampling_logp_difference/max": 1.0933292269706727,
"sampling/sampling_logp_difference/mean": 0.003987031523138285,
"step": 10100,
"step_time": 7.184395595715614
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1617.0,
"completions/max_terminated_length": 1307.3,
"completions/mean_length": 167.8890625,
"completions/mean_terminated_length": 152.44870834350587,
"completions/min_length": 68.7,
"completions/min_terminated_length": 68.7,
"entropy": 0.04599333731457591,
"epoch": 21.64882226980728,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.09423828125,
"learning_rate": 8.9891e-06,
"loss": -0.0056,
"num_tokens": 1018908572.0,
"reward": 1.0524609565734864,
"reward_std": 0.19995204284787177,
"rewards/reward_accuracy/mean": 0.953125,
"rewards/reward_accuracy/std": 0.19665814712643623,
"rewards/reward_format/mean": 0.09933593943715095,
"rewards/reward_format/std": 0.00548338950611651,
"sampling/importance_sampling_ratio/max": 2.5703131198883056,
"sampling/importance_sampling_ratio/mean": 0.9841715812683105,
"sampling/importance_sampling_ratio/min": 0.09153402652591466,
"sampling/sampling_logp_difference/max": 1.0819766759872436,
"sampling/sampling_logp_difference/mean": 0.004137911391444505,
"step": 10110,
"step_time": 7.854305541914073
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1326.0,
"completions/max_terminated_length": 1195.5,
"completions/mean_length": 151.86953125,
"completions/mean_terminated_length": 148.93558197021486,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.043875165306963025,
"epoch": 21.670235546038544,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.423828125,
"learning_rate": 8.988100000000001e-06,
"loss": -0.0063,
"num_tokens": 1019820478.0,
"reward": 1.0675000190734862,
"reward_std": 0.14229700416326524,
"rewards/reward_accuracy/mean": 0.967578125,
"rewards/reward_accuracy/std": 0.14197241738438607,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.0010101743275299669,
"sampling/importance_sampling_ratio/max": 2.463259482383728,
"sampling/importance_sampling_ratio/mean": 0.9865207076072693,
"sampling/importance_sampling_ratio/min": 0.12145134340971708,
"sampling/sampling_logp_difference/max": 0.8726588487625122,
"sampling/sampling_logp_difference/mean": 0.00409919077064842,
"step": 10120,
"step_time": 6.459229998491355
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1079.9,
"completions/max_terminated_length": 858.4,
"completions/mean_length": 141.99296875,
"completions/mean_terminated_length": 140.51310119628906,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.037907908926717936,
"epoch": 21.69164882226981,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.70703125,
"learning_rate": 8.9871e-06,
"loss": -0.0046,
"num_tokens": 1020701356.0,
"reward": 1.0823632955551148,
"reward_std": 0.10173318043816834,
"rewards/reward_accuracy/mean": 0.982421875,
"rewards/reward_accuracy/std": 0.10096903294324874,
"rewards/reward_format/mean": 0.09994140714406967,
"rewards/reward_format/std": 0.0009375000605359674,
"sampling/importance_sampling_ratio/max": 2.5372581005096437,
"sampling/importance_sampling_ratio/mean": 0.9885545194149017,
"sampling/importance_sampling_ratio/min": 0.12996770441532135,
"sampling/sampling_logp_difference/max": 0.8302749872207642,
"sampling/sampling_logp_difference/mean": 0.003836960927583277,
"step": 10130,
"step_time": 5.196458905789768
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1290.0,
"completions/max_terminated_length": 1158.6,
"completions/mean_length": 160.105078125,
"completions/mean_terminated_length": 154.3149444580078,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.044635672401636836,
"epoch": 21.71306209850107,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.091796875,
"learning_rate": 8.9861e-06,
"loss": -0.0032,
"num_tokens": 1021624377.0,
"reward": 1.0598242342472077,
"reward_std": 0.13361041024327278,
"rewards/reward_accuracy/mean": 0.96015625,
"rewards/reward_accuracy/std": 0.13181475922465324,
"rewards/reward_format/mean": 0.09966797009110451,
"rewards/reward_format/std": 0.003411072725430131,
"sampling/importance_sampling_ratio/max": 2.5790364027023314,
"sampling/importance_sampling_ratio/mean": 0.9801924228668213,
"sampling/importance_sampling_ratio/min": 0.1547185257077217,
"sampling/sampling_logp_difference/max": 1.0113398790359498,
"sampling/sampling_logp_difference/mean": 0.004318035510368645,
"step": 10140,
"step_time": 6.371183307599859
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1314.2,
"completions/max_terminated_length": 1183.1,
"completions/mean_length": 170.875,
"completions/mean_terminated_length": 162.84579620361328,
"completions/min_length": 69.1,
"completions/min_terminated_length": 69.1,
"entropy": 0.04455638634972274,
"epoch": 21.734475374732334,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.494140625,
"learning_rate": 8.985100000000001e-06,
"loss": 0.0012,
"num_tokens": 1022586265.0,
"reward": 1.0702734351158143,
"reward_std": 0.13938558027148246,
"rewards/reward_accuracy/mean": 0.970703125,
"rewards/reward_accuracy/std": 0.13768252059817315,
"rewards/reward_format/mean": 0.09957031235098839,
"rewards/reward_format/std": 0.0038992925081402065,
"sampling/importance_sampling_ratio/max": 2.4974366188049317,
"sampling/importance_sampling_ratio/mean": 0.9750323176383973,
"sampling/importance_sampling_ratio/min": 0.027366238087415694,
"sampling/sampling_logp_difference/max": 1.2622469305992126,
"sampling/sampling_logp_difference/mean": 0.0041418279288336635,
"step": 10150,
"step_time": 6.565924244295457
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1269.7,
"completions/max_terminated_length": 1145.6,
"completions/mean_length": 155.763671875,
"completions/mean_terminated_length": 149.95037689208985,
"completions/min_length": 64.4,
"completions/min_terminated_length": 64.4,
"entropy": 0.04331202975008637,
"epoch": 21.7558886509636,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.45703125,
"learning_rate": 8.984100000000001e-06,
"loss": -0.002,
"num_tokens": 1023503772.0,
"reward": 1.0676953315734863,
"reward_std": 0.14924731031060218,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.14810579344630243,
"rewards/reward_format/mean": 0.09972656294703483,
"rewards/reward_format/std": 0.0023031399119645356,
"sampling/importance_sampling_ratio/max": 2.4065336346626283,
"sampling/importance_sampling_ratio/mean": 0.9810685515403748,
"sampling/importance_sampling_ratio/min": 0.053105014562606814,
"sampling/sampling_logp_difference/max": 1.100105392932892,
"sampling/sampling_logp_difference/mean": 0.0042511434759944676,
"step": 10160,
"step_time": 6.321838602222852
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1404.6,
"completions/max_terminated_length": 1281.1,
"completions/mean_length": 155.846484375,
"completions/mean_terminated_length": 150.7228744506836,
"completions/min_length": 58.4,
"completions/min_terminated_length": 58.4,
"entropy": 0.04667678370606154,
"epoch": 21.77730192719486,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.53515625,
"learning_rate": 8.9831e-06,
"loss": -0.0074,
"num_tokens": 1024422531.0,
"reward": 1.0649804949760437,
"reward_std": 0.15686415871605278,
"rewards/reward_accuracy/mean": 0.965234375,
"rewards/reward_accuracy/std": 0.1551368698477745,
"rewards/reward_format/mean": 0.0997460961341858,
"rewards/reward_format/std": 0.0027708411682397125,
"sampling/importance_sampling_ratio/max": 2.3961092710494993,
"sampling/importance_sampling_ratio/mean": 0.9848257601261139,
"sampling/importance_sampling_ratio/min": 0.10174353569746017,
"sampling/sampling_logp_difference/max": 1.1846657872200013,
"sampling/sampling_logp_difference/mean": 0.004218118218705058,
"step": 10170,
"step_time": 6.74434007089585
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1777.5,
"completions/max_terminated_length": 1315.5,
"completions/mean_length": 162.740234375,
"completions/mean_terminated_length": 147.9527145385742,
"completions/min_length": 63.1,
"completions/min_terminated_length": 63.1,
"entropy": 0.04891718947328627,
"epoch": 21.798715203426124,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.302734375,
"learning_rate": 8.9821e-06,
"loss": -0.0134,
"num_tokens": 1025351738.0,
"reward": 1.0677148699760437,
"reward_std": 0.1547832079231739,
"rewards/reward_accuracy/mean": 0.968359375,
"rewards/reward_accuracy/std": 0.15151948779821395,
"rewards/reward_format/mean": 0.09935547038912773,
"rewards/reward_format/std": 0.005845897807739675,
"sampling/importance_sampling_ratio/max": 2.502026653289795,
"sampling/importance_sampling_ratio/mean": 0.9883608639240264,
"sampling/importance_sampling_ratio/min": 0.13242033012211324,
"sampling/sampling_logp_difference/max": 1.1450449228286743,
"sampling/sampling_logp_difference/mean": 0.003956435900181532,
"step": 10180,
"step_time": 8.435266339365626
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1749.2,
"completions/max_terminated_length": 1360.9,
"completions/mean_length": 176.480078125,
"completions/mean_terminated_length": 163.2969825744629,
"completions/min_length": 69.9,
"completions/min_terminated_length": 69.9,
"entropy": 0.05171437179669738,
"epoch": 21.820128479657388,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.220703125,
"learning_rate": 8.981100000000001e-06,
"loss": -0.0066,
"num_tokens": 1026327143.0,
"reward": 1.0593164205551147,
"reward_std": 0.16410770565271376,
"rewards/reward_accuracy/mean": 0.959765625,
"rewards/reward_accuracy/std": 0.16192117109894752,
"rewards/reward_format/mean": 0.0995507813990116,
"rewards/reward_format/std": 0.004468390787951648,
"sampling/importance_sampling_ratio/max": 2.3464462518692017,
"sampling/importance_sampling_ratio/mean": 0.9814011633396149,
"sampling/importance_sampling_ratio/min": 0.05507134636864066,
"sampling/sampling_logp_difference/max": 1.1050967812538146,
"sampling/sampling_logp_difference/mean": 0.004614736023359001,
"step": 10190,
"step_time": 8.40208401979471
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1144.7,
"completions/max_terminated_length": 856.1,
"completions/mean_length": 158.303125,
"completions/mean_terminated_length": 149.4576675415039,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.03830897784791887,
"epoch": 21.841541755888652,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.09521484375,
"learning_rate": 8.9801e-06,
"loss": 0.0,
"num_tokens": 1027246639.0,
"reward": 1.0765039443969726,
"reward_std": 0.11042684242129326,
"rewards/reward_accuracy/mean": 0.976953125,
"rewards/reward_accuracy/std": 0.10859133154153824,
"rewards/reward_format/mean": 0.09955078363418579,
"rewards/reward_format/std": 0.003680312680080533,
"sampling/importance_sampling_ratio/max": 2.559686207771301,
"sampling/importance_sampling_ratio/mean": 0.9812040328979492,
"sampling/importance_sampling_ratio/min": 0.1527220904827118,
"sampling/sampling_logp_difference/max": 0.8410094559192658,
"sampling/sampling_logp_difference/mean": 0.003616907703690231,
"step": 10200,
"step_time": 5.747005846889806
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1283.9,
"completions/max_terminated_length": 1045.9,
"completions/mean_length": 179.8765625,
"completions/mean_terminated_length": 163.5159484863281,
"completions/min_length": 62.1,
"completions/min_terminated_length": 62.1,
"entropy": 0.049794056359678505,
"epoch": 21.862955032119913,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.0,
"learning_rate": 8.9791e-06,
"loss": -0.0082,
"num_tokens": 1028225363.0,
"reward": 1.0465625166893004,
"reward_std": 0.17529404386878014,
"rewards/reward_accuracy/mean": 0.947265625,
"rewards/reward_accuracy/std": 0.17332593351602554,
"rewards/reward_format/mean": 0.09929687678813934,
"rewards/reward_format/std": 0.004599639400839806,
"sampling/importance_sampling_ratio/max": 2.4797157764434816,
"sampling/importance_sampling_ratio/mean": 0.9932537198066711,
"sampling/importance_sampling_ratio/min": 0.09857828095555306,
"sampling/sampling_logp_difference/max": 1.1977557778358459,
"sampling/sampling_logp_difference/mean": 0.004167436296120286,
"step": 10210,
"step_time": 6.435524170685676
},
{
"clip_ratio/high_max": 1.1742602509912103e-05,
"clip_ratio/high_mean": 1.467825313739013e-06,
"clip_ratio/low_mean": 2.81478455690376e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.2826098706427725e-06,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1453.1,
"completions/max_terminated_length": 1324.5,
"completions/mean_length": 166.989453125,
"completions/mean_terminated_length": 150.08236694335938,
"completions/min_length": 61.2,
"completions/min_terminated_length": 61.2,
"entropy": 0.045601386297494176,
"epoch": 21.884368308351178,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0771484375,
"learning_rate": 8.978100000000001e-06,
"loss": -0.009,
"num_tokens": 1029172968.0,
"reward": 1.050273448228836,
"reward_std": 0.17381225675344467,
"rewards/reward_accuracy/mean": 0.951171875,
"rewards/reward_accuracy/std": 0.17132497131824492,
"rewards/reward_format/mean": 0.09910156279802322,
"rewards/reward_format/std": 0.0049659507116302844,
"sampling/importance_sampling_ratio/max": 2.593815302848816,
"sampling/importance_sampling_ratio/mean": 0.9795648455619812,
"sampling/importance_sampling_ratio/min": 0.10344833955168724,
"sampling/sampling_logp_difference/max": 1.0012267887592317,
"sampling/sampling_logp_difference/mean": 0.004212839133106172,
"step": 10220,
"step_time": 7.070969536708435
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1594.8,
"completions/max_terminated_length": 1455.2,
"completions/mean_length": 175.112109375,
"completions/mean_terminated_length": 162.63087768554686,
"completions/min_length": 65.6,
"completions/min_terminated_length": 65.6,
"entropy": 0.05005024285055697,
"epoch": 21.905781584582442,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.515625,
"learning_rate": 8.9771e-06,
"loss": -0.0049,
"num_tokens": 1030135255.0,
"reward": 1.0686718940734863,
"reward_std": 0.14458301961421965,
"rewards/reward_accuracy/mean": 0.969140625,
"rewards/reward_accuracy/std": 0.14269593209028245,
"rewards/reward_format/mean": 0.0995312511920929,
"rewards/reward_format/std": 0.004670966975390911,
"sampling/importance_sampling_ratio/max": 2.606619954109192,
"sampling/importance_sampling_ratio/mean": 0.9760836064815521,
"sampling/importance_sampling_ratio/min": 0.04209691844880581,
"sampling/sampling_logp_difference/max": 1.0984333992004394,
"sampling/sampling_logp_difference/mean": 0.004641410987824201,
"step": 10230,
"step_time": 7.767159132123925
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1666.3,
"completions/max_terminated_length": 1409.9,
"completions/mean_length": 173.576171875,
"completions/mean_terminated_length": 161.1583221435547,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.04347955118864775,
"epoch": 21.927194860813703,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.150390625,
"learning_rate": 8.9761e-06,
"loss": 0.001,
"num_tokens": 1031104106.0,
"reward": 1.079257845878601,
"reward_std": 0.12296846881508827,
"rewards/reward_accuracy/mean": 0.9796875,
"rewards/reward_accuracy/std": 0.1200037233531475,
"rewards/reward_format/mean": 0.09957031458616257,
"rewards/reward_format/std": 0.004654643265530467,
"sampling/importance_sampling_ratio/max": 2.430980622768402,
"sampling/importance_sampling_ratio/mean": 0.9884303212165833,
"sampling/importance_sampling_ratio/min": 0.15033550634980203,
"sampling/sampling_logp_difference/max": 0.9343992471694946,
"sampling/sampling_logp_difference/mean": 0.0041069448692724105,
"step": 10240,
"step_time": 8.197222730499925
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1375.2,
"completions/max_terminated_length": 935.0,
"completions/mean_length": 149.85625,
"completions/mean_terminated_length": 143.9370346069336,
"completions/min_length": 62.6,
"completions/min_terminated_length": 62.6,
"entropy": 0.03853293848223984,
"epoch": 21.948608137044967,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0,
"learning_rate": 8.975100000000002e-06,
"loss": -0.002,
"num_tokens": 1032008394.0,
"reward": 1.0785937786102295,
"reward_std": 0.12018885910511017,
"rewards/reward_accuracy/mean": 0.97890625,
"rewards/reward_accuracy/std": 0.11776105761528015,
"rewards/reward_format/mean": 0.09968750178813934,
"rewards/reward_format/std": 0.0035244155908003448,
"sampling/importance_sampling_ratio/max": 2.416616177558899,
"sampling/importance_sampling_ratio/mean": 0.9832953751087189,
"sampling/importance_sampling_ratio/min": 0.17931273132562636,
"sampling/sampling_logp_difference/max": 1.0581430494785309,
"sampling/sampling_logp_difference/mean": 0.003848026623018086,
"step": 10250,
"step_time": 6.473482608591439
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1499.5,
"completions/max_terminated_length": 1207.9,
"completions/mean_length": 166.01484375,
"completions/mean_terminated_length": 155.82455444335938,
"completions/min_length": 64.4,
"completions/min_terminated_length": 64.4,
"entropy": 0.047260865475982426,
"epoch": 21.970021413276232,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.345703125,
"learning_rate": 8.974100000000001e-06,
"loss": -0.0042,
"num_tokens": 1032948064.0,
"reward": 1.0616601824760437,
"reward_std": 0.17636330500245095,
"rewards/reward_accuracy/mean": 0.962109375,
"rewards/reward_accuracy/std": 0.1743452176451683,
"rewards/reward_format/mean": 0.09955078214406968,
"rewards/reward_format/std": 0.004134347150102258,
"sampling/importance_sampling_ratio/max": 2.5674745559692385,
"sampling/importance_sampling_ratio/mean": 0.9862704157829285,
"sampling/importance_sampling_ratio/min": 0.04556631133891642,
"sampling/sampling_logp_difference/max": 1.0334250211715699,
"sampling/sampling_logp_difference/mean": 0.00434551602229476,
"step": 10260,
"step_time": 7.153084889610182
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1246.1,
"completions/max_terminated_length": 1085.8,
"completions/mean_length": 147.66484375,
"completions/mean_terminated_length": 142.47111053466796,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.03861658887472004,
"epoch": 21.991434689507496,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.08544921875,
"learning_rate": 8.9731e-06,
"loss": -0.0026,
"num_tokens": 1033839222.0,
"reward": 1.0712695360183715,
"reward_std": 0.12553115040063859,
"rewards/reward_accuracy/mean": 0.971484375,
"rewards/reward_accuracy/std": 0.12418005764484405,
"rewards/reward_format/mean": 0.09978515654802322,
"rewards/reward_format/std": 0.0026407783152535558,
"sampling/importance_sampling_ratio/max": 2.5409610509872436,
"sampling/importance_sampling_ratio/mean": 0.9859081745147705,
"sampling/importance_sampling_ratio/min": 0.12182356417179108,
"sampling/sampling_logp_difference/max": 1.1217045307159423,
"sampling/sampling_logp_difference/mean": 0.004143342119641602,
"step": 10270,
"step_time": 6.0645936975866785
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1208.9,
"completions/max_terminated_length": 1017.0,
"completions/mean_length": 160.626953125,
"completions/mean_terminated_length": 148.1184555053711,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.04291476882062852,
"epoch": 22.012847965738757,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.9721e-06,
"loss": -0.0064,
"num_tokens": 1034761899.0,
"reward": 1.044492208957672,
"reward_std": 0.16587355360388756,
"rewards/reward_accuracy/mean": 0.944921875,
"rewards/reward_accuracy/std": 0.16453572735190392,
"rewards/reward_format/mean": 0.09957031384110451,
"rewards/reward_format/std": 0.0034213694743812084,
"sampling/importance_sampling_ratio/max": 2.4665167212486265,
"sampling/importance_sampling_ratio/mean": 0.9909249901771545,
"sampling/importance_sampling_ratio/min": 0.14430411141365768,
"sampling/sampling_logp_difference/max": 0.9303108334541321,
"sampling/sampling_logp_difference/mean": 0.004075661231763661,
"step": 10280,
"step_time": 5.963559139697463
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1533.2,
"completions/max_terminated_length": 1456.4,
"completions/mean_length": 168.856640625,
"completions/mean_terminated_length": 160.84713897705078,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.04806088849436492,
"epoch": 22.03426124197002,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.7265625,
"learning_rate": 8.9711e-06,
"loss": -0.0113,
"num_tokens": 1035712876.0,
"reward": 1.0665625154972076,
"reward_std": 0.14451129958033562,
"rewards/reward_accuracy/mean": 0.966796875,
"rewards/reward_accuracy/std": 0.1436442144215107,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0021960600512102245,
"sampling/importance_sampling_ratio/max": 2.49831622838974,
"sampling/importance_sampling_ratio/mean": 0.9899373948574066,
"sampling/importance_sampling_ratio/min": 0.1279186189174652,
"sampling/sampling_logp_difference/max": 0.9956238150596619,
"sampling/sampling_logp_difference/mean": 0.004388277628459036,
"step": 10290,
"step_time": 7.352581561400439
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1272.3,
"completions/max_terminated_length": 1207.1,
"completions/mean_length": 158.916796875,
"completions/mean_terminated_length": 156.73951873779296,
"completions/min_length": 60.7,
"completions/min_terminated_length": 60.7,
"entropy": 0.04471008435357362,
"epoch": 22.055674518201286,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.75390625,
"learning_rate": 8.9701e-06,
"loss": -0.0017,
"num_tokens": 1036636039.0,
"reward": 1.0752148568630218,
"reward_std": 0.1206319659948349,
"rewards/reward_accuracy/mean": 0.975390625,
"rewards/reward_accuracy/std": 0.12002793103456497,
"rewards/reward_format/mean": 0.0998242199420929,
"rewards/reward_format/std": 0.0020767973037436604,
"sampling/importance_sampling_ratio/max": 2.399261248111725,
"sampling/importance_sampling_ratio/mean": 0.9795794725418091,
"sampling/importance_sampling_ratio/min": 0.10940364338457584,
"sampling/sampling_logp_difference/max": 1.0862724304199218,
"sampling/sampling_logp_difference/mean": 0.004109886521473527,
"step": 10300,
"step_time": 6.231853342810064
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1298.4,
"completions/max_terminated_length": 1227.9,
"completions/mean_length": 158.354296875,
"completions/mean_terminated_length": 153.20387115478516,
"completions/min_length": 61.4,
"completions/min_terminated_length": 61.4,
"entropy": 0.04343030992895365,
"epoch": 22.077087794432547,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.15234375,
"learning_rate": 8.9691e-06,
"loss": -0.005,
"num_tokens": 1037554802.0,
"reward": 1.0548046946525573,
"reward_std": 0.18579302430152894,
"rewards/reward_accuracy/mean": 0.955078125,
"rewards/reward_accuracy/std": 0.18437879011034966,
"rewards/reward_format/mean": 0.09972656294703483,
"rewards/reward_format/std": 0.0026798263657838105,
"sampling/importance_sampling_ratio/max": 2.336378538608551,
"sampling/importance_sampling_ratio/mean": 0.983100539445877,
"sampling/importance_sampling_ratio/min": 0.17697094306349753,
"sampling/sampling_logp_difference/max": 0.9616771042346954,
"sampling/sampling_logp_difference/mean": 0.00394122910220176,
"step": 10310,
"step_time": 6.357477696085698
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1421.3,
"completions/max_terminated_length": 936.7,
"completions/mean_length": 153.538671875,
"completions/mean_terminated_length": 147.59242401123046,
"completions/min_length": 67.4,
"completions/min_terminated_length": 67.4,
"entropy": 0.04102408867329359,
"epoch": 22.09850107066381,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.45703125,
"learning_rate": 8.968100000000001e-06,
"loss": 0.0012,
"num_tokens": 1038466405.0,
"reward": 1.065000021457672,
"reward_std": 0.12960509359836578,
"rewards/reward_accuracy/mean": 0.965234375,
"rewards/reward_accuracy/std": 0.12864028811454772,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.003142323181964457,
"sampling/importance_sampling_ratio/max": 2.609473133087158,
"sampling/importance_sampling_ratio/mean": 0.9926814556121826,
"sampling/importance_sampling_ratio/min": 0.19389764592051506,
"sampling/sampling_logp_difference/max": 1.4160896301269532,
"sampling/sampling_logp_difference/mean": 0.003976694238372147,
"step": 10320,
"step_time": 6.666028933413327
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1453.0,
"completions/max_terminated_length": 1197.4,
"completions/mean_length": 165.34375,
"completions/mean_terminated_length": 152.897509765625,
"completions/min_length": 70.7,
"completions/min_terminated_length": 70.7,
"entropy": 0.0484831724781543,
"epoch": 22.119914346895076,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.34765625,
"learning_rate": 8.967100000000001e-06,
"loss": -0.0058,
"num_tokens": 1039411845.0,
"reward": 1.0706640958786011,
"reward_std": 0.13310189545154572,
"rewards/reward_accuracy/mean": 0.97109375,
"rewards/reward_accuracy/std": 0.13123570680618285,
"rewards/reward_format/mean": 0.09957031458616257,
"rewards/reward_format/std": 0.003521105321124196,
"sampling/importance_sampling_ratio/max": 2.4028846979141236,
"sampling/importance_sampling_ratio/mean": 0.9775763511657715,
"sampling/importance_sampling_ratio/min": 0.10945716500282288,
"sampling/sampling_logp_difference/max": 0.914342737197876,
"sampling/sampling_logp_difference/mean": 0.00431482729036361,
"step": 10330,
"step_time": 7.201531531402725
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1724.7,
"completions/max_terminated_length": 1297.2,
"completions/mean_length": 166.872265625,
"completions/mean_terminated_length": 154.3629608154297,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.04293321764562279,
"epoch": 22.141327623126337,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.1025390625,
"learning_rate": 8.9661e-06,
"loss": -0.0011,
"num_tokens": 1040361582.0,
"reward": 1.0529492437839507,
"reward_std": 0.19394872486591339,
"rewards/reward_accuracy/mean": 0.953515625,
"rewards/reward_accuracy/std": 0.19153387770056723,
"rewards/reward_format/mean": 0.09943359568715096,
"rewards/reward_format/std": 0.005324986320920289,
"sampling/importance_sampling_ratio/max": 2.529900860786438,
"sampling/importance_sampling_ratio/mean": 0.9777911961078644,
"sampling/importance_sampling_ratio/min": 0.12722740937024354,
"sampling/sampling_logp_difference/max": 0.9986561954021453,
"sampling/sampling_logp_difference/mean": 0.004284406057558953,
"step": 10340,
"step_time": 8.185292090996517
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1578.8,
"completions/max_terminated_length": 1407.1,
"completions/mean_length": 161.4265625,
"completions/mean_terminated_length": 157.02226867675782,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"entropy": 0.04089033124037087,
"epoch": 22.1627408993576,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.2294921875,
"learning_rate": 8.965100000000002e-06,
"loss": -0.0093,
"num_tokens": 1041292018.0,
"reward": 1.068125021457672,
"reward_std": 0.1432836391031742,
"rewards/reward_accuracy/mean": 0.968359375,
"rewards/reward_accuracy/std": 0.1416305996477604,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0028951086569577456,
"sampling/importance_sampling_ratio/max": 2.385604405403137,
"sampling/importance_sampling_ratio/mean": 0.9818327009677887,
"sampling/importance_sampling_ratio/min": 0.03833083398640156,
"sampling/sampling_logp_difference/max": 0.8652629137039185,
"sampling/sampling_logp_difference/mean": 0.003719772747717798,
"step": 10350,
"step_time": 7.49710702309967
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.2415081982908304e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.2415081982908304e-06,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1438.4,
"completions/max_terminated_length": 870.8,
"completions/mean_length": 164.68359375,
"completions/mean_terminated_length": 152.23700790405275,
"completions/min_length": 69.9,
"completions/min_terminated_length": 69.9,
"entropy": 0.04223510657902807,
"epoch": 22.184154175588866,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.2216796875,
"learning_rate": 8.964100000000001e-06,
"loss": -0.002,
"num_tokens": 1042225976.0,
"reward": 1.0664062798023224,
"reward_std": 0.14665701538324355,
"rewards/reward_accuracy/mean": 0.966796875,
"rewards/reward_accuracy/std": 0.14399684220552444,
"rewards/reward_format/mean": 0.09960937723517418,
"rewards/reward_format/std": 0.0037758355028927326,
"sampling/importance_sampling_ratio/max": 2.5903748989105226,
"sampling/importance_sampling_ratio/mean": 0.9944024026393891,
"sampling/importance_sampling_ratio/min": 0.14924866929650307,
"sampling/sampling_logp_difference/max": 0.8964144706726074,
"sampling/sampling_logp_difference/mean": 0.003878481430001557,
"step": 10360,
"step_time": 7.0047861702012595
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 1144.3,
"completions/max_terminated_length": 979.1,
"completions/mean_length": 141.146484375,
"completions/mean_terminated_length": 140.4046417236328,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.03614263567142188,
"epoch": 22.20556745182013,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.7109375,
"learning_rate": 8.9631e-06,
"loss": -0.0021,
"num_tokens": 1043098863.0,
"reward": 1.0819531440734864,
"reward_std": 0.09992626309394836,
"rewards/reward_accuracy/mean": 0.98203125,
"rewards/reward_accuracy/std": 0.09938446953892707,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.0008516391506418585,
"sampling/importance_sampling_ratio/max": 2.43747820854187,
"sampling/importance_sampling_ratio/mean": 0.9866033852100372,
"sampling/importance_sampling_ratio/min": 0.1211180955171585,
"sampling/sampling_logp_difference/max": 0.9159818172454834,
"sampling/sampling_logp_difference/mean": 0.0036426482954993846,
"step": 10370,
"step_time": 5.407733112783172
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 896.2,
"completions/max_terminated_length": 839.9,
"completions/mean_length": 164.894140625,
"completions/mean_terminated_length": 148.67166137695312,
"completions/min_length": 69.1,
"completions/min_terminated_length": 69.1,
"entropy": 0.0392669941065833,
"epoch": 22.22698072805139,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.255859375,
"learning_rate": 8.9621e-06,
"loss": -0.0022,
"num_tokens": 1044044816.0,
"reward": 1.0622265815734864,
"reward_std": 0.15884629115462304,
"rewards/reward_accuracy/mean": 0.962890625,
"rewards/reward_accuracy/std": 0.15612626895308496,
"rewards/reward_format/mean": 0.0993359386920929,
"rewards/reward_format/std": 0.0038317086175084112,
"sampling/importance_sampling_ratio/max": 2.4328485488891602,
"sampling/importance_sampling_ratio/mean": 0.9944740533828735,
"sampling/importance_sampling_ratio/min": 0.22926225513219833,
"sampling/sampling_logp_difference/max": 0.9781107783317566,
"sampling/sampling_logp_difference/mean": 0.003721110289916396,
"step": 10380,
"step_time": 5.107092531910166
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1186.3,
"completions/max_terminated_length": 930.0,
"completions/mean_length": 157.6515625,
"completions/mean_terminated_length": 153.32328033447266,
"completions/min_length": 65.2,
"completions/min_terminated_length": 65.2,
"entropy": 0.0424015452619642,
"epoch": 22.248394004282655,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.265625,
"learning_rate": 8.9611e-06,
"loss": -0.0031,
"num_tokens": 1044964164.0,
"reward": 1.068457043170929,
"reward_std": 0.13333532437682152,
"rewards/reward_accuracy/mean": 0.96875,
"rewards/reward_accuracy/std": 0.1325280860066414,
"rewards/reward_format/mean": 0.09970703199505807,
"rewards/reward_format/std": 0.0027995655545964837,
"sampling/importance_sampling_ratio/max": 2.308517026901245,
"sampling/importance_sampling_ratio/mean": 0.9933332324028015,
"sampling/importance_sampling_ratio/min": 0.17322768978774547,
"sampling/sampling_logp_difference/max": 0.9124200880527497,
"sampling/sampling_logp_difference/mean": 0.004097060021013022,
"step": 10390,
"step_time": 5.9183423071895955
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1845.1,
"completions/max_terminated_length": 1776.8,
"completions/mean_length": 209.0421875,
"completions/mean_terminated_length": 189.01521911621094,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.059105402790009975,
"epoch": 22.26980728051392,
"frac_reward_zero_std": 0.85625,
"grad_norm": 0.390625,
"learning_rate": 8.9601e-06,
"loss": -0.0062,
"num_tokens": 1046018544.0,
"reward": 1.0353320717811585,
"reward_std": 0.21273796260356903,
"rewards/reward_accuracy/mean": 0.936328125,
"rewards/reward_accuracy/std": 0.21033623516559602,
"rewards/reward_format/mean": 0.09900390803813934,
"rewards/reward_format/std": 0.0069975091610103846,
"sampling/importance_sampling_ratio/max": 2.5257225036621094,
"sampling/importance_sampling_ratio/mean": 0.9765821397304535,
"sampling/importance_sampling_ratio/min": 0.06999089196324348,
"sampling/sampling_logp_difference/max": 0.855638462305069,
"sampling/sampling_logp_difference/mean": 0.004608244588598609,
"step": 10400,
"step_time": 9.263199436801369
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1848.5,
"completions/max_terminated_length": 1367.8,
"completions/mean_length": 170.15703125,
"completions/mean_terminated_length": 155.43119735717772,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.04795139369089156,
"epoch": 22.29122055674518,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.1171875,
"learning_rate": 8.9591e-06,
"loss": -0.0017,
"num_tokens": 1046970674.0,
"reward": 1.047949230670929,
"reward_std": 0.1947140820324421,
"rewards/reward_accuracy/mean": 0.9484375,
"rewards/reward_accuracy/std": 0.1922920525074005,
"rewards/reward_format/mean": 0.09951171949505806,
"rewards/reward_format/std": 0.005190184200182557,
"sampling/importance_sampling_ratio/max": 2.3900524377822876,
"sampling/importance_sampling_ratio/mean": 0.9693203747272492,
"sampling/importance_sampling_ratio/min": 0.028258028719574214,
"sampling/sampling_logp_difference/max": 0.9879268765449524,
"sampling/sampling_logp_difference/mean": 0.004285033023916185,
"step": 10410,
"step_time": 8.873591078518075
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1294.3,
"completions/max_terminated_length": 960.8,
"completions/mean_length": 151.222265625,
"completions/mean_terminated_length": 142.33348236083984,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.03995493757538497,
"epoch": 22.312633832976445,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.447265625,
"learning_rate": 8.958100000000002e-06,
"loss": -0.0012,
"num_tokens": 1047868123.0,
"reward": 1.0832226753234864,
"reward_std": 0.1106949046254158,
"rewards/reward_accuracy/mean": 0.98359375,
"rewards/reward_accuracy/std": 0.10861576721072197,
"rewards/reward_format/mean": 0.09962890669703484,
"rewards/reward_format/std": 0.0031624906696379185,
"sampling/importance_sampling_ratio/max": 2.4485907435417174,
"sampling/importance_sampling_ratio/mean": 0.984165471792221,
"sampling/importance_sampling_ratio/min": 0.10531915202736855,
"sampling/sampling_logp_difference/max": 0.9771452188491822,
"sampling/sampling_logp_difference/mean": 0.004003972187638283,
"step": 10420,
"step_time": 6.1709231038024885
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 1014.2,
"completions/max_terminated_length": 995.0,
"completions/mean_length": 152.81796875,
"completions/mean_terminated_length": 152.09298858642578,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"entropy": 0.03580146508757025,
"epoch": 22.33404710920771,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.62890625,
"learning_rate": 8.957100000000001e-06,
"loss": -0.0005,
"num_tokens": 1048782137.0,
"reward": 1.0655664265155793,
"reward_std": 0.1393769472837448,
"rewards/reward_accuracy/mean": 0.965625,
"rewards/reward_accuracy/std": 0.13905395194888115,
"rewards/reward_format/mean": 0.09994140714406967,
"rewards/reward_format/std": 0.0009375000605359674,
"sampling/importance_sampling_ratio/max": 2.581614637374878,
"sampling/importance_sampling_ratio/mean": 0.999406224489212,
"sampling/importance_sampling_ratio/min": 0.12028852701187134,
"sampling/sampling_logp_difference/max": 1.0027145981788634,
"sampling/sampling_logp_difference/mean": 0.0035768750123679636,
"step": 10430,
"step_time": 5.014489173394395
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1263.9,
"completions/max_terminated_length": 1045.3,
"completions/mean_length": 148.513671875,
"completions/mean_terminated_length": 145.56387023925782,
"completions/min_length": 69.4,
"completions/min_terminated_length": 69.4,
"entropy": 0.03947074864991009,
"epoch": 22.355460385438974,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.7109375,
"learning_rate": 8.9561e-06,
"loss": -0.0004,
"num_tokens": 1049677116.0,
"reward": 1.0569531440734863,
"reward_std": 0.14899953901767732,
"rewards/reward_accuracy/mean": 0.95703125,
"rewards/reward_accuracy/std": 0.14805234968662262,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.0012500001117587089,
"sampling/importance_sampling_ratio/max": 2.398005425930023,
"sampling/importance_sampling_ratio/mean": 0.985773766040802,
"sampling/importance_sampling_ratio/min": 0.08634203895926476,
"sampling/sampling_logp_difference/max": 1.036128830909729,
"sampling/sampling_logp_difference/mean": 0.004001086624339223,
"step": 10440,
"step_time": 6.009397427586373
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 4.939890254718194e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.939890254718194e-06,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1047.1,
"completions/max_terminated_length": 787.8,
"completions/mean_length": 146.978515625,
"completions/mean_terminated_length": 135.06402740478515,
"completions/min_length": 62.8,
"completions/min_terminated_length": 62.8,
"entropy": 0.04074815874919295,
"epoch": 22.376873661670235,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.51953125,
"learning_rate": 8.955100000000002e-06,
"loss": -0.002,
"num_tokens": 1050565877.0,
"reward": 1.046386754512787,
"reward_std": 0.19923774823546408,
"rewards/reward_accuracy/mean": 0.946875,
"rewards/reward_accuracy/std": 0.19677697345614434,
"rewards/reward_format/mean": 0.09951172098517418,
"rewards/reward_format/std": 0.0033750889822840692,
"sampling/importance_sampling_ratio/max": 2.4093422889709473,
"sampling/importance_sampling_ratio/mean": 0.9975963950157165,
"sampling/importance_sampling_ratio/min": 0.1860888690687716,
"sampling/sampling_logp_difference/max": 0.9041197180747986,
"sampling/sampling_logp_difference/mean": 0.004029153031297028,
"step": 10450,
"step_time": 5.310935328909546
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1554.5,
"completions/max_terminated_length": 1191.7,
"completions/mean_length": 169.234765625,
"completions/mean_terminated_length": 158.2037139892578,
"completions/min_length": 65.3,
"completions/min_terminated_length": 65.3,
"entropy": 0.04593511971179396,
"epoch": 22.3982869379015,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0,
"learning_rate": 8.954100000000001e-06,
"loss": -0.0074,
"num_tokens": 1051513438.0,
"reward": 1.0523242473602294,
"reward_std": 0.19776245951652527,
"rewards/reward_accuracy/mean": 0.952734375,
"rewards/reward_accuracy/std": 0.19595204666256905,
"rewards/reward_format/mean": 0.09958984553813935,
"rewards/reward_format/std": 0.004385497118346393,
"sampling/importance_sampling_ratio/max": 2.336388278007507,
"sampling/importance_sampling_ratio/mean": 0.9881064891815186,
"sampling/importance_sampling_ratio/min": 0.11627790592610836,
"sampling/sampling_logp_difference/max": 1.1558636128902435,
"sampling/sampling_logp_difference/mean": 0.004212285368703305,
"step": 10460,
"step_time": 7.4501801454083765
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1311.4,
"completions/max_terminated_length": 1105.1,
"completions/mean_length": 161.155078125,
"completions/mean_terminated_length": 151.70977172851562,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.04569548745639622,
"epoch": 22.419700214132764,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.232421875,
"learning_rate": 8.9531e-06,
"loss": -0.0049,
"num_tokens": 1052442315.0,
"reward": 1.0644336104393006,
"reward_std": 0.15789547115564345,
"rewards/reward_accuracy/mean": 0.96484375,
"rewards/reward_accuracy/std": 0.1560504652559757,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.004011838836595416,
"sampling/importance_sampling_ratio/max": 2.632699155807495,
"sampling/importance_sampling_ratio/mean": 0.9911126255989074,
"sampling/importance_sampling_ratio/min": 0.13308805311098695,
"sampling/sampling_logp_difference/max": 0.9740715324878693,
"sampling/sampling_logp_difference/mean": 0.004228121507912875,
"step": 10470,
"step_time": 6.528449485599412
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1343.4,
"completions/max_terminated_length": 1020.3,
"completions/mean_length": 165.344921875,
"completions/mean_terminated_length": 159.48271789550782,
"completions/min_length": 66.3,
"completions/min_terminated_length": 66.3,
"entropy": 0.041809912235476074,
"epoch": 22.441113490364025,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.412109375,
"learning_rate": 8.9521e-06,
"loss": -0.0008,
"num_tokens": 1053386542.0,
"reward": 1.0798046946525575,
"reward_std": 0.1040661494480446,
"rewards/reward_accuracy/mean": 0.980078125,
"rewards/reward_accuracy/std": 0.10238381400704384,
"rewards/reward_format/mean": 0.09972656294703483,
"rewards/reward_format/std": 0.0030180982546880843,
"sampling/importance_sampling_ratio/max": 2.3865711212158205,
"sampling/importance_sampling_ratio/mean": 0.989032655954361,
"sampling/importance_sampling_ratio/min": 0.1360705778002739,
"sampling/sampling_logp_difference/max": 1.0297012090682984,
"sampling/sampling_logp_difference/mean": 0.0037123041693121195,
"step": 10480,
"step_time": 6.543625073498697
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1106.2,
"completions/max_terminated_length": 786.3,
"completions/mean_length": 142.121875,
"completions/mean_terminated_length": 139.14723205566406,
"completions/min_length": 61.5,
"completions/min_terminated_length": 61.5,
"entropy": 0.03471760663669556,
"epoch": 22.46252676659529,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.45703125,
"learning_rate": 8.9511e-06,
"loss": -0.0048,
"num_tokens": 1054272166.0,
"reward": 1.0881640791893006,
"reward_std": 0.06835267990827561,
"rewards/reward_accuracy/mean": 0.98828125,
"rewards/reward_accuracy/std": 0.067298324406147,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.001507148751989007,
"sampling/importance_sampling_ratio/max": 2.5733180046081543,
"sampling/importance_sampling_ratio/mean": 0.9967054486274719,
"sampling/importance_sampling_ratio/min": 0.24070340842008592,
"sampling/sampling_logp_difference/max": 0.7770016670227051,
"sampling/sampling_logp_difference/mean": 0.0035342250717803835,
"step": 10490,
"step_time": 5.426523691602052
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1489.5,
"completions/max_terminated_length": 1284.9,
"completions/mean_length": 151.066015625,
"completions/mean_terminated_length": 143.73876342773437,
"completions/min_length": 65.2,
"completions/min_terminated_length": 65.2,
"entropy": 0.042631473229266706,
"epoch": 22.483940042826553,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.15625,
"learning_rate": 8.950100000000001e-06,
"loss": -0.0034,
"num_tokens": 1055171935.0,
"reward": 1.0641601800918579,
"reward_std": 0.17064929828047753,
"rewards/reward_accuracy/mean": 0.964453125,
"rewards/reward_accuracy/std": 0.1689760409295559,
"rewards/reward_format/mean": 0.09970703199505807,
"rewards/reward_format/std": 0.002786072716116905,
"sampling/importance_sampling_ratio/max": 2.4373642086982725,
"sampling/importance_sampling_ratio/mean": 0.9998380303382873,
"sampling/importance_sampling_ratio/min": 0.09524808079004288,
"sampling/sampling_logp_difference/max": 0.9328644394874572,
"sampling/sampling_logp_difference/mean": 0.004258635290898383,
"step": 10500,
"step_time": 6.967206240486121
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1472.9,
"completions/max_terminated_length": 1153.6,
"completions/mean_length": 168.634375,
"completions/mean_terminated_length": 157.7908203125,
"completions/min_length": 68.5,
"completions/min_terminated_length": 68.5,
"entropy": 0.04535581734962761,
"epoch": 22.505353319057814,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.53515625,
"learning_rate": 8.9491e-06,
"loss": -0.0046,
"num_tokens": 1056133047.0,
"reward": 1.0817187786102296,
"reward_std": 0.10667988359928131,
"rewards/reward_accuracy/mean": 0.98203125,
"rewards/reward_accuracy/std": 0.10503793880343437,
"rewards/reward_format/mean": 0.09968750178813934,
"rewards/reward_format/std": 0.0029076686827465893,
"sampling/importance_sampling_ratio/max": 2.410214161872864,
"sampling/importance_sampling_ratio/mean": 0.9833658337593079,
"sampling/importance_sampling_ratio/min": 0.1035507284104824,
"sampling/sampling_logp_difference/max": 0.7753914535045624,
"sampling/sampling_logp_difference/mean": 0.004012914327904582,
"step": 10510,
"step_time": 7.1358127672981935
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1258.2,
"completions/max_terminated_length": 1079.9,
"completions/mean_length": 156.8578125,
"completions/mean_terminated_length": 149.5406967163086,
"completions/min_length": 67.7,
"completions/min_terminated_length": 67.7,
"entropy": 0.04009689837694168,
"epoch": 22.52676659528908,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.1572265625,
"learning_rate": 8.9481e-06,
"loss": -0.0105,
"num_tokens": 1057049211.0,
"reward": 1.0806054890155792,
"reward_std": 0.10351783260703087,
"rewards/reward_accuracy/mean": 0.980859375,
"rewards/reward_accuracy/std": 0.1023735262453556,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.002772300271317363,
"sampling/importance_sampling_ratio/max": 2.2340165615081786,
"sampling/importance_sampling_ratio/mean": 0.9784435927867889,
"sampling/importance_sampling_ratio/min": 0.11061042579822242,
"sampling/sampling_logp_difference/max": 1.0771741271018982,
"sampling/sampling_logp_difference/mean": 0.004023193521425128,
"step": 10520,
"step_time": 6.181916871198337
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1280.3,
"completions/max_terminated_length": 890.8,
"completions/mean_length": 154.84921875,
"completions/mean_terminated_length": 145.28346557617186,
"completions/min_length": 63.2,
"completions/min_terminated_length": 63.2,
"entropy": 0.03698408573400229,
"epoch": 22.548179871520343,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.25,
"learning_rate": 8.947100000000001e-06,
"loss": -0.003,
"num_tokens": 1057964393.0,
"reward": 1.077793002128601,
"reward_std": 0.12142918929457665,
"rewards/reward_accuracy/mean": 0.978125,
"rewards/reward_accuracy/std": 0.11948045790195465,
"rewards/reward_format/mean": 0.09966797083616256,
"rewards/reward_format/std": 0.003509897645562887,
"sampling/importance_sampling_ratio/max": 2.413894546031952,
"sampling/importance_sampling_ratio/mean": 0.9881499350070954,
"sampling/importance_sampling_ratio/min": 0.1418574083596468,
"sampling/sampling_logp_difference/max": 0.93661128282547,
"sampling/sampling_logp_difference/mean": 0.003656682185828686,
"step": 10530,
"step_time": 6.3699348010064565
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1522.5,
"completions/max_terminated_length": 1361.4,
"completions/mean_length": 185.362890625,
"completions/mean_terminated_length": 173.79906616210937,
"completions/min_length": 67.3,
"completions/min_terminated_length": 67.3,
"entropy": 0.05068251236807555,
"epoch": 22.569593147751608,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.359375,
"learning_rate": 8.9461e-06,
"loss": -0.014,
"num_tokens": 1058965322.0,
"reward": 1.0491211116313934,
"reward_std": 0.1762927182018757,
"rewards/reward_accuracy/mean": 0.949609375,
"rewards/reward_accuracy/std": 0.1740542955696583,
"rewards/reward_format/mean": 0.09951172024011612,
"rewards/reward_format/std": 0.004919611196964979,
"sampling/importance_sampling_ratio/max": 2.4636523723602295,
"sampling/importance_sampling_ratio/mean": 0.9861987888813019,
"sampling/importance_sampling_ratio/min": 0.08920553885400295,
"sampling/sampling_logp_difference/max": 1.1655906438827515,
"sampling/sampling_logp_difference/mean": 0.004139188514091075,
"step": 10540,
"step_time": 7.600504328610259
},
{
"clip_ratio/high_max": 4.792767995240865e-05,
"clip_ratio/high_mean": 5.9909599940510814e-06,
"clip_ratio/low_mean": 1.9023440245291567e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 7.893304018580239e-06,
"completions/clipped_ratio": 0.0171875,
"completions/max_length": 1701.9,
"completions/max_terminated_length": 1463.9,
"completions/mean_length": 182.2703125,
"completions/mean_terminated_length": 149.64044494628905,
"completions/min_length": 60.6,
"completions/min_terminated_length": 60.6,
"entropy": 0.04620401442516595,
"epoch": 22.59100642398287,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.765625,
"learning_rate": 8.945100000000002e-06,
"loss": -0.0065,
"num_tokens": 1059946238.0,
"reward": 1.0450976729393004,
"reward_std": 0.2081979736685753,
"rewards/reward_accuracy/mean": 0.946484375,
"rewards/reward_accuracy/std": 0.20305677205324174,
"rewards/reward_format/mean": 0.09861328229308128,
"rewards/reward_format/std": 0.008839333173818886,
"sampling/importance_sampling_ratio/max": 2.356709384918213,
"sampling/importance_sampling_ratio/mean": 0.9853046059608459,
"sampling/importance_sampling_ratio/min": 0.08069416992366314,
"sampling/sampling_logp_difference/max": 1.0965719938278198,
"sampling/sampling_logp_difference/mean": 0.003812933061271906,
"step": 10550,
"step_time": 8.687383654125734
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1685.8,
"completions/max_terminated_length": 1358.9,
"completions/mean_length": 155.23671875,
"completions/mean_terminated_length": 147.09493103027344,
"completions/min_length": 70.7,
"completions/min_terminated_length": 70.7,
"entropy": 0.04380267837550491,
"epoch": 22.612419700214133,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.4296875,
"learning_rate": 8.944100000000001e-06,
"loss": -0.0056,
"num_tokens": 1060860172.0,
"reward": 1.0635156273841857,
"reward_std": 0.16671029925346376,
"rewards/reward_accuracy/mean": 0.963671875,
"rewards/reward_accuracy/std": 0.16595307365059853,
"rewards/reward_format/mean": 0.09984375014901162,
"rewards/reward_format/std": 0.002260174392722547,
"sampling/importance_sampling_ratio/max": 2.6155025959014893,
"sampling/importance_sampling_ratio/mean": 0.9880247712135315,
"sampling/importance_sampling_ratio/min": 0.11860226448625326,
"sampling/sampling_logp_difference/max": 1.1143758177757264,
"sampling/sampling_logp_difference/mean": 0.004220760217867792,
"step": 10560,
"step_time": 7.8509823931875875
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1448.4,
"completions/max_terminated_length": 1153.4,
"completions/mean_length": 164.976953125,
"completions/mean_terminated_length": 154.76771697998046,
"completions/min_length": 67.2,
"completions/min_terminated_length": 67.2,
"entropy": 0.052213155361823735,
"epoch": 22.633832976445397,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.439453125,
"learning_rate": 8.9431e-06,
"loss": -0.0066,
"num_tokens": 1061795169.0,
"reward": 1.0807226777076722,
"reward_std": 0.11457213088870048,
"rewards/reward_accuracy/mean": 0.98125,
"rewards/reward_accuracy/std": 0.11192523166537285,
"rewards/reward_format/mean": 0.0994726575911045,
"rewards/reward_format/std": 0.004624573048204184,
"sampling/importance_sampling_ratio/max": 2.2993577003479,
"sampling/importance_sampling_ratio/mean": 0.9751666784286499,
"sampling/importance_sampling_ratio/min": 0.11765687242150306,
"sampling/sampling_logp_difference/max": 0.9333246231079102,
"sampling/sampling_logp_difference/mean": 0.004433158226311207,
"step": 10570,
"step_time": 7.115168621015618
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1234.8,
"completions/max_terminated_length": 1048.2,
"completions/mean_length": 152.040625,
"completions/mean_terminated_length": 149.11402740478516,
"completions/min_length": 72.2,
"completions/min_terminated_length": 72.2,
"entropy": 0.04503780177328735,
"epoch": 22.65524625267666,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.365234375,
"learning_rate": 8.9421e-06,
"loss": -0.0105,
"num_tokens": 1062700409.0,
"reward": 1.0662304878234863,
"reward_std": 0.1472019411623478,
"rewards/reward_accuracy/mean": 0.96640625,
"rewards/reward_accuracy/std": 0.14650856480002403,
"rewards/reward_format/mean": 0.09982421919703484,
"rewards/reward_format/std": 0.0021842264104634523,
"sampling/importance_sampling_ratio/max": 2.4223269701004027,
"sampling/importance_sampling_ratio/mean": 0.9863190174102783,
"sampling/importance_sampling_ratio/min": 0.06986672468483449,
"sampling/sampling_logp_difference/max": 1.214803647994995,
"sampling/sampling_logp_difference/mean": 0.0040404332336038355,
"step": 10580,
"step_time": 5.933554852608358
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1067.4,
"completions/max_terminated_length": 924.5,
"completions/mean_length": 164.413671875,
"completions/mean_terminated_length": 157.19663848876954,
"completions/min_length": 61.0,
"completions/min_terminated_length": 61.0,
"entropy": 0.0424272790318355,
"epoch": 22.676659528907923,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.427734375,
"learning_rate": 8.9411e-06,
"loss": -0.003,
"num_tokens": 1063638764.0,
"reward": 1.0606640815734862,
"reward_std": 0.1599855341017246,
"rewards/reward_accuracy/mean": 0.9609375,
"rewards/reward_accuracy/std": 0.15911196991801263,
"rewards/reward_format/mean": 0.0997265636920929,
"rewards/reward_format/std": 0.0024893516907468437,
"sampling/importance_sampling_ratio/max": 2.437709426879883,
"sampling/importance_sampling_ratio/mean": 0.9860654652118683,
"sampling/importance_sampling_ratio/min": 0.14708497524261474,
"sampling/sampling_logp_difference/max": 0.9004934668540955,
"sampling/sampling_logp_difference/mean": 0.0038363582221791147,
"step": 10590,
"step_time": 5.430878627195488
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1578.2,
"completions/max_terminated_length": 1084.7,
"completions/mean_length": 163.326171875,
"completions/mean_terminated_length": 152.30887145996093,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"entropy": 0.04384330930188298,
"epoch": 22.698072805139187,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.3515625,
"learning_rate": 8.940100000000001e-06,
"loss": -0.0005,
"num_tokens": 1064570511.0,
"reward": 1.0815429925918578,
"reward_std": 0.11501546204090118,
"rewards/reward_accuracy/mean": 0.98203125,
"rewards/reward_accuracy/std": 0.11190463975071907,
"rewards/reward_format/mean": 0.09951172024011612,
"rewards/reward_format/std": 0.0046477736439555885,
"sampling/importance_sampling_ratio/max": 2.5321133136749268,
"sampling/importance_sampling_ratio/mean": 0.9795280992984772,
"sampling/importance_sampling_ratio/min": 0.15638548508286476,
"sampling/sampling_logp_difference/max": 1.134131634235382,
"sampling/sampling_logp_difference/mean": 0.004389725858345628,
"step": 10600,
"step_time": 7.477206595588359
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1272.0,
"completions/max_terminated_length": 1068.9,
"completions/mean_length": 153.1859375,
"completions/mean_terminated_length": 150.21504745483398,
"completions/min_length": 62.4,
"completions/min_terminated_length": 62.4,
"entropy": 0.04231904742773622,
"epoch": 22.719486081370448,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.419921875,
"learning_rate": 8.9391e-06,
"loss": -0.0042,
"num_tokens": 1065482939.0,
"reward": 1.0596093893051148,
"reward_std": 0.15416546941269188,
"rewards/reward_accuracy/mean": 0.959765625,
"rewards/reward_accuracy/std": 0.1529403656721115,
"rewards/reward_format/mean": 0.09984375089406967,
"rewards/reward_format/std": 0.0018923229305073618,
"sampling/importance_sampling_ratio/max": 2.4520410299301147,
"sampling/importance_sampling_ratio/mean": 0.9988929986953735,
"sampling/importance_sampling_ratio/min": 0.06440422534942628,
"sampling/sampling_logp_difference/max": 0.8976291537284851,
"sampling/sampling_logp_difference/mean": 0.004191004438325763,
"step": 10610,
"step_time": 6.096271226505633
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 907.5,
"completions/max_terminated_length": 822.5,
"completions/mean_length": 136.16875,
"completions/mean_terminated_length": 135.42128295898436,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.03533289032056928,
"epoch": 22.740899357601712,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.15625,
"learning_rate": 8.9381e-06,
"loss": -0.0032,
"num_tokens": 1066342779.0,
"reward": 1.0753515839576722,
"reward_std": 0.12869777381420136,
"rewards/reward_accuracy/mean": 0.975390625,
"rewards/reward_accuracy/std": 0.12824612781405448,
"rewards/reward_format/mean": 0.0999609388411045,
"rewards/reward_format/std": 0.0006250000558793544,
"sampling/importance_sampling_ratio/max": 2.4577083826065063,
"sampling/importance_sampling_ratio/mean": 0.9999989151954651,
"sampling/importance_sampling_ratio/min": 0.24122582674026488,
"sampling/sampling_logp_difference/max": 0.9629599094390869,
"sampling/sampling_logp_difference/mean": 0.0038358719320967793,
"step": 10620,
"step_time": 4.557758763901075
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1113.9,
"completions/max_terminated_length": 1044.4,
"completions/mean_length": 155.64296875,
"completions/mean_terminated_length": 151.94654846191406,
"completions/min_length": 71.4,
"completions/min_terminated_length": 71.4,
"entropy": 0.039301906968466936,
"epoch": 22.762312633832977,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.126953125,
"learning_rate": 8.937100000000001e-06,
"loss": -0.0066,
"num_tokens": 1067263881.0,
"reward": 1.077207052707672,
"reward_std": 0.11667254865169525,
"rewards/reward_accuracy/mean": 0.97734375,
"rewards/reward_accuracy/std": 0.11590976566076279,
"rewards/reward_format/mean": 0.09986328259110451,
"rewards/reward_format/std": 0.0015493134735152126,
"sampling/importance_sampling_ratio/max": 2.5786189317703245,
"sampling/importance_sampling_ratio/mean": 0.9939113676548004,
"sampling/importance_sampling_ratio/min": 0.14166908860206603,
"sampling/sampling_logp_difference/max": 1.0521565437316895,
"sampling/sampling_logp_difference/mean": 0.003972064913250506,
"step": 10630,
"step_time": 5.554653104598401
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1124.8,
"completions/max_terminated_length": 945.1,
"completions/mean_length": 142.441015625,
"completions/mean_terminated_length": 140.95846862792968,
"completions/min_length": 66.4,
"completions/min_terminated_length": 66.4,
"entropy": 0.03655128336977213,
"epoch": 22.78372591006424,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.337890625,
"learning_rate": 8.9361e-06,
"loss": 0.0044,
"num_tokens": 1068147570.0,
"reward": 1.0917578220367432,
"reward_std": 0.06517385095357894,
"rewards/reward_accuracy/mean": 0.991796875,
"rewards/reward_accuracy/std": 0.06485476717352867,
"rewards/reward_format/mean": 0.09996093809604645,
"rewards/reward_format/std": 0.0006250000093132258,
"sampling/importance_sampling_ratio/max": 2.4242687940597536,
"sampling/importance_sampling_ratio/mean": 0.9943747162818909,
"sampling/importance_sampling_ratio/min": 0.17646422684192659,
"sampling/sampling_logp_difference/max": 0.8620517730712891,
"sampling/sampling_logp_difference/mean": 0.0038437532028183343,
"step": 10640,
"step_time": 5.470700686521013
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1455.1,
"completions/max_terminated_length": 1089.7,
"completions/mean_length": 176.36171875,
"completions/mean_terminated_length": 159.5897232055664,
"completions/min_length": 67.1,
"completions/min_terminated_length": 67.1,
"entropy": 0.04654333468060941,
"epoch": 22.805139186295502,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.87890625,
"learning_rate": 8.9351e-06,
"loss": -0.0112,
"num_tokens": 1069117680.0,
"reward": 1.0519141018390656,
"reward_std": 0.18334302082657813,
"rewards/reward_accuracy/mean": 0.952734375,
"rewards/reward_accuracy/std": 0.17993892803788186,
"rewards/reward_format/mean": 0.09917968958616256,
"rewards/reward_format/std": 0.006331449141725898,
"sampling/importance_sampling_ratio/max": 2.4785815238952638,
"sampling/importance_sampling_ratio/mean": 0.9857713580131531,
"sampling/importance_sampling_ratio/min": 0.1243865977972746,
"sampling/sampling_logp_difference/max": 1.0328370392322541,
"sampling/sampling_logp_difference/mean": 0.00412209655623883,
"step": 10650,
"step_time": 7.32826694061514
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1138.8,
"completions/max_terminated_length": 1011.3,
"completions/mean_length": 162.075390625,
"completions/mean_terminated_length": 145.04583892822265,
"completions/min_length": 60.1,
"completions/min_terminated_length": 60.1,
"entropy": 0.039844889240339396,
"epoch": 22.826552462526767,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.3828125,
"learning_rate": 8.934100000000001e-06,
"loss": -0.007,
"num_tokens": 1070052641.0,
"reward": 1.0718554973602294,
"reward_std": 0.13381857499480249,
"rewards/reward_accuracy/mean": 0.97265625,
"rewards/reward_accuracy/std": 0.1307935245335102,
"rewards/reward_format/mean": 0.09919922053813934,
"rewards/reward_format/std": 0.0036830145865678785,
"sampling/importance_sampling_ratio/max": 2.546419358253479,
"sampling/importance_sampling_ratio/mean": 0.9895320236682892,
"sampling/importance_sampling_ratio/min": 0.08594542369246483,
"sampling/sampling_logp_difference/max": 1.0984715104103089,
"sampling/sampling_logp_difference/mean": 0.003935588127933443,
"step": 10660,
"step_time": 5.8025105264096055
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1383.4,
"completions/max_terminated_length": 1063.8,
"completions/mean_length": 162.492578125,
"completions/mean_terminated_length": 153.72493438720704,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.043362705316394565,
"epoch": 22.84796573875803,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.933100000000001e-06,
"loss": -0.0079,
"num_tokens": 1070988126.0,
"reward": 1.0538476705551147,
"reward_std": 0.1750231258571148,
"rewards/reward_accuracy/mean": 0.954296875,
"rewards/reward_accuracy/std": 0.17296316251158714,
"rewards/reward_format/mean": 0.09955078214406968,
"rewards/reward_format/std": 0.004525230592116713,
"sampling/importance_sampling_ratio/max": 2.5234028577804564,
"sampling/importance_sampling_ratio/mean": 0.9908046066761017,
"sampling/importance_sampling_ratio/min": 0.09372127279639245,
"sampling/sampling_logp_difference/max": 1.0998252034187317,
"sampling/sampling_logp_difference/mean": 0.003974506794475019,
"step": 10670,
"step_time": 6.900852679199306
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 950.5,
"completions/max_terminated_length": 713.6,
"completions/mean_length": 148.514453125,
"completions/mean_terminated_length": 143.4026321411133,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.03707460700534284,
"epoch": 22.869379014989292,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.0,
"learning_rate": 8.9321e-06,
"loss": 0.0008,
"num_tokens": 1071888755.0,
"reward": 1.0556054949760436,
"reward_std": 0.13176431655883789,
"rewards/reward_accuracy/mean": 0.955859375,
"rewards/reward_accuracy/std": 0.13050920739769936,
"rewards/reward_format/mean": 0.09974609538912774,
"rewards/reward_format/std": 0.0025652997195720673,
"sampling/importance_sampling_ratio/max": 2.4223843455314635,
"sampling/importance_sampling_ratio/mean": 0.982615303993225,
"sampling/importance_sampling_ratio/min": 0.11160962618887424,
"sampling/sampling_logp_difference/max": 1.0317458987236023,
"sampling/sampling_logp_difference/mean": 0.003734084218740463,
"step": 10680,
"step_time": 4.8809747330000395
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1831.3,
"completions/max_terminated_length": 1551.6,
"completions/mean_length": 175.358203125,
"completions/mean_terminated_length": 162.13380737304686,
"completions/min_length": 71.4,
"completions/min_terminated_length": 71.4,
"entropy": 0.04677093895152211,
"epoch": 22.890792291220556,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.388671875,
"learning_rate": 8.9311e-06,
"loss": -0.0095,
"num_tokens": 1072865224.0,
"reward": 1.0696679949760437,
"reward_std": 0.15558312013745307,
"rewards/reward_accuracy/mean": 0.9703125,
"rewards/reward_accuracy/std": 0.1524782732129097,
"rewards/reward_format/mean": 0.09935547113418579,
"rewards/reward_format/std": 0.006051847734488547,
"sampling/importance_sampling_ratio/max": 2.430281627178192,
"sampling/importance_sampling_ratio/mean": 0.9889843106269837,
"sampling/importance_sampling_ratio/min": 0.09648353084921837,
"sampling/sampling_logp_difference/max": 0.888342022895813,
"sampling/sampling_logp_difference/mean": 0.004009679309092462,
"step": 10690,
"step_time": 8.730766126405797
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 966.4,
"completions/max_terminated_length": 829.5,
"completions/mean_length": 148.235546875,
"completions/mean_terminated_length": 143.06665954589843,
"completions/min_length": 65.3,
"completions/min_terminated_length": 65.3,
"entropy": 0.037599802808836104,
"epoch": 22.91220556745182,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.462890625,
"learning_rate": 8.930100000000001e-06,
"loss": -0.0028,
"num_tokens": 1073765907.0,
"reward": 1.065878939628601,
"reward_std": 0.16323170065879822,
"rewards/reward_accuracy/mean": 0.966015625,
"rewards/reward_accuracy/std": 0.1626071184873581,
"rewards/reward_format/mean": 0.09986328333616257,
"rewards/reward_format/std": 0.0014606342650949956,
"sampling/importance_sampling_ratio/max": 2.4791799783706665,
"sampling/importance_sampling_ratio/mean": 0.9857929944992065,
"sampling/importance_sampling_ratio/min": 0.1836682677268982,
"sampling/sampling_logp_difference/max": 0.8821262001991272,
"sampling/sampling_logp_difference/mean": 0.003786496492102742,
"step": 10700,
"step_time": 4.912866774894065
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1239.8,
"completions/max_terminated_length": 1015.1,
"completions/mean_length": 163.96640625,
"completions/mean_terminated_length": 148.6121337890625,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.04425995934288949,
"epoch": 22.933618843683085,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.9291e-06,
"loss": -0.0013,
"num_tokens": 1074705181.0,
"reward": 1.0592578291893004,
"reward_std": 0.15588981434702873,
"rewards/reward_accuracy/mean": 0.959765625,
"rewards/reward_accuracy/std": 0.1534558765590191,
"rewards/reward_format/mean": 0.09949218854308128,
"rewards/reward_format/std": 0.004400196392089129,
"sampling/importance_sampling_ratio/max": 2.448260474205017,
"sampling/importance_sampling_ratio/mean": 1.0086495101451873,
"sampling/importance_sampling_ratio/min": 0.17240044772624968,
"sampling/sampling_logp_difference/max": 0.9306323051452636,
"sampling/sampling_logp_difference/mean": 0.00400047660805285,
"step": 10710,
"step_time": 6.539861790410941
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1466.7,
"completions/max_terminated_length": 1152.7,
"completions/mean_length": 151.998828125,
"completions/mean_terminated_length": 147.58528594970704,
"completions/min_length": 66.5,
"completions/min_terminated_length": 66.5,
"entropy": 0.04090048619545996,
"epoch": 22.955032119914346,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.1396484375,
"learning_rate": 8.9281e-06,
"loss": -0.0038,
"num_tokens": 1075614282.0,
"reward": 1.0521093785762787,
"reward_std": 0.17059227600693702,
"rewards/reward_accuracy/mean": 0.95234375,
"rewards/reward_accuracy/std": 0.16975196227431297,
"rewards/reward_format/mean": 0.09976562485098839,
"rewards/reward_format/std": 0.002618335303850472,
"sampling/importance_sampling_ratio/max": 2.476633644104004,
"sampling/importance_sampling_ratio/mean": 0.9913712918758393,
"sampling/importance_sampling_ratio/min": 0.1221240708604455,
"sampling/sampling_logp_difference/max": 1.0656168580055236,
"sampling/sampling_logp_difference/mean": 0.003797488287091255,
"step": 10720,
"step_time": 7.092312386611593
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1197.5,
"completions/max_terminated_length": 966.3,
"completions/mean_length": 148.234375,
"completions/mean_terminated_length": 139.4390869140625,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.04095057614613325,
"epoch": 22.97644539614561,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.927100000000001e-06,
"loss": -0.0032,
"num_tokens": 1076509378.0,
"reward": 1.0559375166893006,
"reward_std": 0.13586502522230148,
"rewards/reward_accuracy/mean": 0.95625,
"rewards/reward_accuracy/std": 0.13442325517535209,
"rewards/reward_format/mean": 0.09968750104308129,
"rewards/reward_format/std": 0.0035027997801080346,
"sampling/importance_sampling_ratio/max": 2.4003563284873963,
"sampling/importance_sampling_ratio/mean": 1.0003639340400696,
"sampling/importance_sampling_ratio/min": 0.14885502844117582,
"sampling/sampling_logp_difference/max": 0.823220407962799,
"sampling/sampling_logp_difference/mean": 0.0038819076726213098,
"step": 10730,
"step_time": 6.055394358499325
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1088.3,
"completions/max_terminated_length": 875.5,
"completions/mean_length": 158.551953125,
"completions/mean_terminated_length": 151.15872344970703,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.040850417432375254,
"epoch": 22.997858672376875,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.51953125,
"learning_rate": 8.9261e-06,
"loss": -0.0007,
"num_tokens": 1077431127.0,
"reward": 1.0716406464576722,
"reward_std": 0.12731495425105094,
"rewards/reward_accuracy/mean": 0.971875,
"rewards/reward_accuracy/std": 0.12644631117582322,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.002252799575217068,
"sampling/importance_sampling_ratio/max": 2.529621148109436,
"sampling/importance_sampling_ratio/mean": 0.9946456015110016,
"sampling/importance_sampling_ratio/min": 0.10758968703448772,
"sampling/sampling_logp_difference/max": 1.111505663394928,
"sampling/sampling_logp_difference/mean": 0.003850431554019451,
"step": 10740,
"step_time": 5.58665448500542
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1070.0,
"completions/max_terminated_length": 863.5,
"completions/mean_length": 156.3984375,
"completions/mean_terminated_length": 149.8407745361328,
"completions/min_length": 61.6,
"completions/min_terminated_length": 61.6,
"entropy": 0.03840343689080328,
"epoch": 23.019271948608136,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.390625,
"learning_rate": 8.9251e-06,
"loss": -0.0042,
"num_tokens": 1078353347.0,
"reward": 1.0872460961341859,
"reward_std": 0.06646900058258325,
"rewards/reward_accuracy/mean": 0.9875,
"rewards/reward_accuracy/std": 0.06552586033940315,
"rewards/reward_format/mean": 0.09974609389901161,
"rewards/reward_format/std": 0.002251429087482393,
"sampling/importance_sampling_ratio/max": 2.3816129088401796,
"sampling/importance_sampling_ratio/mean": 0.9832936286926269,
"sampling/importance_sampling_ratio/min": 0.12299885898828507,
"sampling/sampling_logp_difference/max": 0.9239485263824463,
"sampling/sampling_logp_difference/mean": 0.0038286619121208785,
"step": 10750,
"step_time": 5.347299147205194
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1311.1,
"completions/max_terminated_length": 1069.8,
"completions/mean_length": 154.944921875,
"completions/mean_terminated_length": 147.5486618041992,
"completions/min_length": 63.5,
"completions/min_terminated_length": 63.5,
"entropy": 0.03858965369872749,
"epoch": 23.0406852248394,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.08056640625,
"learning_rate": 8.924100000000002e-06,
"loss": -0.002,
"num_tokens": 1079262886.0,
"reward": 1.0649023711681367,
"reward_std": 0.12780620902776718,
"rewards/reward_accuracy/mean": 0.965234375,
"rewards/reward_accuracy/std": 0.1262848362326622,
"rewards/reward_format/mean": 0.09966797083616256,
"rewards/reward_format/std": 0.003788912668824196,
"sampling/importance_sampling_ratio/max": 2.3632460594177247,
"sampling/importance_sampling_ratio/mean": 0.9876944899559021,
"sampling/importance_sampling_ratio/min": 0.14211977422237396,
"sampling/sampling_logp_difference/max": 1.0563117027282716,
"sampling/sampling_logp_difference/mean": 0.003632570221088827,
"step": 10760,
"step_time": 6.425511035593809
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1569.3,
"completions/max_terminated_length": 1362.1,
"completions/mean_length": 159.93828125,
"completions/mean_terminated_length": 151.7944190979004,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.03978703054599464,
"epoch": 23.062098501070665,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.072265625,
"learning_rate": 8.923100000000001e-06,
"loss": -0.0034,
"num_tokens": 1080187800.0,
"reward": 1.079785168170929,
"reward_std": 0.10813510522712022,
"rewards/reward_accuracy/mean": 0.980078125,
"rewards/reward_accuracy/std": 0.10616957992315293,
"rewards/reward_format/mean": 0.09970703199505807,
"rewards/reward_format/std": 0.0031409486662596466,
"sampling/importance_sampling_ratio/max": 2.3175467610359193,
"sampling/importance_sampling_ratio/mean": 0.9908424377441406,
"sampling/importance_sampling_ratio/min": 0.06944947633892298,
"sampling/sampling_logp_difference/max": 1.1005295515060425,
"sampling/sampling_logp_difference/mean": 0.0038515626452863216,
"step": 10770,
"step_time": 7.45757361878932
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1387.7,
"completions/max_terminated_length": 1332.5,
"completions/mean_length": 157.13515625,
"completions/mean_terminated_length": 147.55436248779296,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.043551987339742484,
"epoch": 23.083511777301926,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.9221e-06,
"loss": -0.01,
"num_tokens": 1081103906.0,
"reward": 1.0777929782867433,
"reward_std": 0.12423092126846313,
"rewards/reward_accuracy/mean": 0.978125,
"rewards/reward_accuracy/std": 0.1226457990705967,
"rewards/reward_format/mean": 0.09966796934604645,
"rewards/reward_format/std": 0.0029035751475021245,
"sampling/importance_sampling_ratio/max": 2.2845808267593384,
"sampling/importance_sampling_ratio/mean": 0.9881495714187623,
"sampling/importance_sampling_ratio/min": 0.10911577306687832,
"sampling/sampling_logp_difference/max": 0.9499104022979736,
"sampling/sampling_logp_difference/mean": 0.004066437552683056,
"step": 10780,
"step_time": 6.90393098119821
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 976.2,
"completions/max_terminated_length": 907.8,
"completions/mean_length": 152.848828125,
"completions/mean_terminated_length": 144.83525390625,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.038922880915924905,
"epoch": 23.10492505353319,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.2333984375,
"learning_rate": 8.9211e-06,
"loss": -0.0027,
"num_tokens": 1082016415.0,
"reward": 1.074804711341858,
"reward_std": 0.11794127821922303,
"rewards/reward_accuracy/mean": 0.975,
"rewards/reward_accuracy/std": 0.11696624606847764,
"rewards/reward_format/mean": 0.09980468899011612,
"rewards/reward_format/std": 0.0018412381410598754,
"sampling/importance_sampling_ratio/max": 2.5297925233840943,
"sampling/importance_sampling_ratio/mean": 0.9819395363330841,
"sampling/importance_sampling_ratio/min": 0.18938303347676994,
"sampling/sampling_logp_difference/max": 0.926686143875122,
"sampling/sampling_logp_difference/mean": 0.003976716613397002,
"step": 10790,
"step_time": 5.079423634009435
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1601.9,
"completions/max_terminated_length": 1200.1,
"completions/mean_length": 170.074609375,
"completions/mean_terminated_length": 158.28963470458984,
"completions/min_length": 67.6,
"completions/min_terminated_length": 67.6,
"entropy": 0.04574004437308758,
"epoch": 23.126338329764454,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.40234375,
"learning_rate": 8.920100000000001e-06,
"loss": -0.0062,
"num_tokens": 1082967646.0,
"reward": 1.0624023735523225,
"reward_std": 0.14170069128740578,
"rewards/reward_accuracy/mean": 0.962890625,
"rewards/reward_accuracy/std": 0.13918514028191567,
"rewards/reward_format/mean": 0.09951172098517418,
"rewards/reward_format/std": 0.004944381304085255,
"sampling/importance_sampling_ratio/max": 2.4776118755340577,
"sampling/importance_sampling_ratio/mean": 0.9835100173950195,
"sampling/importance_sampling_ratio/min": 0.07198480237275362,
"sampling/sampling_logp_difference/max": 1.115980863571167,
"sampling/sampling_logp_difference/mean": 0.004087671055458486,
"step": 10800,
"step_time": 7.695896506018471
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1085.4,
"completions/max_terminated_length": 956.4,
"completions/mean_length": 150.569140625,
"completions/mean_terminated_length": 149.0955047607422,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"entropy": 0.038257134472951294,
"epoch": 23.14775160599572,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.9191e-06,
"loss": -0.004,
"num_tokens": 1083864799.0,
"reward": 1.0725976824760437,
"reward_std": 0.11462055221199989,
"rewards/reward_accuracy/mean": 0.97265625,
"rewards/reward_accuracy/std": 0.11423055678606034,
"rewards/reward_format/mean": 0.09994140788912773,
"rewards/reward_format/std": 0.0006976742763072253,
"sampling/importance_sampling_ratio/max": 2.365223431587219,
"sampling/importance_sampling_ratio/mean": 0.9788910567760467,
"sampling/importance_sampling_ratio/min": 0.15448665618896484,
"sampling/sampling_logp_difference/max": 0.9571831226348877,
"sampling/sampling_logp_difference/mean": 0.0038404559018090367,
"step": 10810,
"step_time": 5.204239920701366
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 887.6,
"completions/max_terminated_length": 694.0,
"completions/mean_length": 144.94296875,
"completions/mean_terminated_length": 140.51983184814452,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.03942033876664937,
"epoch": 23.16916488222698,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.357421875,
"learning_rate": 8.9181e-06,
"loss": -0.0006,
"num_tokens": 1084756797.0,
"reward": 1.086132824420929,
"reward_std": 0.09124622493982315,
"rewards/reward_accuracy/mean": 0.986328125,
"rewards/reward_accuracy/std": 0.09043559432029724,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.0020581001648679377,
"sampling/importance_sampling_ratio/max": 2.3013423681259155,
"sampling/importance_sampling_ratio/mean": 0.9712607026100158,
"sampling/importance_sampling_ratio/min": 0.08778598755598069,
"sampling/sampling_logp_difference/max": 1.2404415011405945,
"sampling/sampling_logp_difference/mean": 0.0039729527197778225,
"step": 10820,
"step_time": 4.96229062389757
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1629.1,
"completions/max_terminated_length": 1403.1,
"completions/mean_length": 179.711328125,
"completions/mean_terminated_length": 168.13966598510743,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.05048826588317752,
"epoch": 23.190578158458244,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.451171875,
"learning_rate": 8.917100000000001e-06,
"loss": -0.0086,
"num_tokens": 1085738906.0,
"reward": 1.0615429759025574,
"reward_std": 0.16554950773715973,
"rewards/reward_accuracy/mean": 0.962109375,
"rewards/reward_accuracy/std": 0.16352660953998566,
"rewards/reward_format/mean": 0.09943359494209289,
"rewards/reward_format/std": 0.004648353136144578,
"sampling/importance_sampling_ratio/max": 2.3900372982025146,
"sampling/importance_sampling_ratio/mean": 0.9782253324985504,
"sampling/importance_sampling_ratio/min": 0.034391114860773085,
"sampling/sampling_logp_difference/max": 0.991605281829834,
"sampling/sampling_logp_difference/mean": 0.004209560551680624,
"step": 10830,
"step_time": 7.824285765117383
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1266.8,
"completions/max_terminated_length": 817.4,
"completions/mean_length": 144.589453125,
"completions/mean_terminated_length": 140.8711181640625,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.036543356417678294,
"epoch": 23.21199143468951,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.1630859375,
"learning_rate": 8.916100000000001e-06,
"loss": -0.0089,
"num_tokens": 1086625375.0,
"reward": 1.086679708957672,
"reward_std": 0.08470564633607865,
"rewards/reward_accuracy/mean": 0.98671875,
"rewards/reward_accuracy/std": 0.08408064916729927,
"rewards/reward_format/mean": 0.0999609388411045,
"rewards/reward_format/std": 0.0006250000558793544,
"sampling/importance_sampling_ratio/max": 2.4147802591323853,
"sampling/importance_sampling_ratio/mean": 0.9928894877433777,
"sampling/importance_sampling_ratio/min": 0.09999929443001747,
"sampling/sampling_logp_difference/max": 1.0244981288909911,
"sampling/sampling_logp_difference/mean": 0.0038720491575077176,
"step": 10840,
"step_time": 6.02175260767981
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1332.3,
"completions/max_terminated_length": 1059.5,
"completions/mean_length": 152.240625,
"completions/mean_terminated_length": 147.8413070678711,
"completions/min_length": 63.1,
"completions/min_terminated_length": 63.1,
"entropy": 0.03919440086465329,
"epoch": 23.23340471092077,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.2470703125,
"learning_rate": 8.9151e-06,
"loss": -0.0062,
"num_tokens": 1087527335.0,
"reward": 1.0603320479393006,
"reward_std": 0.16855397447943687,
"rewards/reward_accuracy/mean": 0.960546875,
"rewards/reward_accuracy/std": 0.16740190610289574,
"rewards/reward_format/mean": 0.09978515729308128,
"rewards/reward_format/std": 0.0029578487621620296,
"sampling/importance_sampling_ratio/max": 2.616542935371399,
"sampling/importance_sampling_ratio/mean": 0.9761627972126007,
"sampling/importance_sampling_ratio/min": 0.15474732145667075,
"sampling/sampling_logp_difference/max": 0.9681435286998749,
"sampling/sampling_logp_difference/mean": 0.0038269149838015435,
"step": 10850,
"step_time": 6.417382313217968
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1601.0,
"completions/max_terminated_length": 1466.0,
"completions/mean_length": 174.72890625,
"completions/mean_terminated_length": 164.52031555175782,
"completions/min_length": 66.3,
"completions/min_terminated_length": 66.3,
"entropy": 0.043208601395599545,
"epoch": 23.254817987152034,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.228515625,
"learning_rate": 8.914100000000002e-06,
"loss": -0.0108,
"num_tokens": 1088500817.0,
"reward": 1.056914085149765,
"reward_std": 0.1728774130344391,
"rewards/reward_accuracy/mean": 0.957421875,
"rewards/reward_accuracy/std": 0.17047596275806426,
"rewards/reward_format/mean": 0.0994921900331974,
"rewards/reward_format/std": 0.004620881378650665,
"sampling/importance_sampling_ratio/max": 2.492960739135742,
"sampling/importance_sampling_ratio/mean": 0.9805504262447358,
"sampling/importance_sampling_ratio/min": 0.07485727332532406,
"sampling/sampling_logp_difference/max": 0.8482987403869628,
"sampling/sampling_logp_difference/mean": 0.0038854712154716255,
"step": 10860,
"step_time": 7.583331999718212
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1209.6,
"completions/max_terminated_length": 1178.7,
"completions/mean_length": 153.9125,
"completions/mean_terminated_length": 148.80459747314453,
"completions/min_length": 63.2,
"completions/min_terminated_length": 63.2,
"entropy": 0.03893164261244238,
"epoch": 23.2762312633833,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.41796875,
"learning_rate": 8.913100000000001e-06,
"loss": -0.0099,
"num_tokens": 1089406977.0,
"reward": 1.0704883098602296,
"reward_std": 0.13532194569706918,
"rewards/reward_accuracy/mean": 0.970703125,
"rewards/reward_accuracy/std": 0.13434977754950522,
"rewards/reward_format/mean": 0.09978515729308128,
"rewards/reward_format/std": 0.002153738238848746,
"sampling/importance_sampling_ratio/max": 2.376233148574829,
"sampling/importance_sampling_ratio/mean": 0.9884368479251862,
"sampling/importance_sampling_ratio/min": 0.19336889870464802,
"sampling/sampling_logp_difference/max": 0.8524165868759155,
"sampling/sampling_logp_difference/mean": 0.0037359279114753006,
"step": 10870,
"step_time": 5.798978788405657
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1583.7,
"completions/max_terminated_length": 1188.3,
"completions/mean_length": 180.220703125,
"completions/mean_terminated_length": 167.35823974609374,
"completions/min_length": 63.9,
"completions/min_terminated_length": 63.9,
"entropy": 0.05016585034318268,
"epoch": 23.29764453961456,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.08056640625,
"learning_rate": 8.9121e-06,
"loss": -0.0053,
"num_tokens": 1090383958.0,
"reward": 1.0646093964576722,
"reward_std": 0.13988770619034768,
"rewards/reward_accuracy/mean": 0.965234375,
"rewards/reward_accuracy/std": 0.13745709508657455,
"rewards/reward_format/mean": 0.09937500134110451,
"rewards/reward_format/std": 0.004620500607416034,
"sampling/importance_sampling_ratio/max": 2.4291008949279784,
"sampling/importance_sampling_ratio/mean": 0.979663610458374,
"sampling/importance_sampling_ratio/min": 0.1186062466353178,
"sampling/sampling_logp_difference/max": 1.06727414727211,
"sampling/sampling_logp_difference/mean": 0.004154702695086598,
"step": 10880,
"step_time": 7.887443607489695
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1414.9,
"completions/max_terminated_length": 1213.2,
"completions/mean_length": 164.414453125,
"completions/mean_terminated_length": 151.13365325927734,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.04822918646968901,
"epoch": 23.319057815845824,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.9111e-06,
"loss": -0.0023,
"num_tokens": 1091322779.0,
"reward": 1.0667773604393005,
"reward_std": 0.13362879827618598,
"rewards/reward_accuracy/mean": 0.9671875,
"rewards/reward_accuracy/std": 0.13190170451998712,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.004175769677385688,
"sampling/importance_sampling_ratio/max": 2.3532623052597046,
"sampling/importance_sampling_ratio/mean": 0.9907898306846619,
"sampling/importance_sampling_ratio/min": 0.1480512298643589,
"sampling/sampling_logp_difference/max": 0.999416708946228,
"sampling/sampling_logp_difference/mean": 0.004075677576474845,
"step": 10890,
"step_time": 7.021890271391021
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1121.2,
"completions/max_terminated_length": 1097.4,
"completions/mean_length": 148.54140625,
"completions/mean_terminated_length": 146.33791961669922,
"completions/min_length": 69.6,
"completions/min_terminated_length": 69.6,
"entropy": 0.03818531152792275,
"epoch": 23.340471092077088,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.12890625,
"learning_rate": 8.9101e-06,
"loss": 0.0029,
"num_tokens": 1092221941.0,
"reward": 1.0623437821865083,
"reward_std": 0.14776523932814598,
"rewards/reward_accuracy/mean": 0.9625,
"rewards/reward_accuracy/std": 0.1471736826002598,
"rewards/reward_format/mean": 0.09984375163912773,
"rewards/reward_format/std": 0.0017731342697516084,
"sampling/importance_sampling_ratio/max": 2.4038988828659056,
"sampling/importance_sampling_ratio/mean": 0.985241687297821,
"sampling/importance_sampling_ratio/min": 0.10154645517468452,
"sampling/sampling_logp_difference/max": 1.0211077988147736,
"sampling/sampling_logp_difference/mean": 0.003983186627738178,
"step": 10900,
"step_time": 5.529207691192278
},
{
"clip_ratio/high_max": 2.0495162971201353e-06,
"clip_ratio/high_mean": 2.561895371400169e-07,
"clip_ratio/low_mean": 2.561895371400169e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 5.123790742800338e-07,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1430.9,
"completions/max_terminated_length": 1363.4,
"completions/mean_length": 166.530859375,
"completions/mean_terminated_length": 153.43600463867188,
"completions/min_length": 59.4,
"completions/min_terminated_length": 59.4,
"entropy": 0.04823767566122115,
"epoch": 23.361884368308353,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.0,
"learning_rate": 8.9091e-06,
"loss": -0.0025,
"num_tokens": 1093162484.0,
"reward": 1.0553906381130218,
"reward_std": 0.17975931614637375,
"rewards/reward_accuracy/mean": 0.955859375,
"rewards/reward_accuracy/std": 0.17790045887231826,
"rewards/reward_format/mean": 0.09953124970197677,
"rewards/reward_format/std": 0.0038511776132509113,
"sampling/importance_sampling_ratio/max": 2.4673697471618654,
"sampling/importance_sampling_ratio/mean": 0.9813957214355469,
"sampling/importance_sampling_ratio/min": 0.09981561396270991,
"sampling/sampling_logp_difference/max": 0.892678290605545,
"sampling/sampling_logp_difference/mean": 0.00421724917832762,
"step": 10910,
"step_time": 7.118615771594341
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1772.5,
"completions/max_terminated_length": 1583.3,
"completions/mean_length": 183.406640625,
"completions/mean_terminated_length": 169.52445373535156,
"completions/min_length": 67.6,
"completions/min_terminated_length": 67.6,
"entropy": 0.047796660521999004,
"epoch": 23.383297644539613,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.376953125,
"learning_rate": 8.9081e-06,
"loss": -0.0054,
"num_tokens": 1094153397.0,
"reward": 1.0391992449760437,
"reward_std": 0.22241268008947374,
"rewards/reward_accuracy/mean": 0.93984375,
"rewards/reward_accuracy/std": 0.2200958698987961,
"rewards/reward_format/mean": 0.09935547038912773,
"rewards/reward_format/std": 0.005097488965839147,
"sampling/importance_sampling_ratio/max": 2.473501992225647,
"sampling/importance_sampling_ratio/mean": 0.9846067428588867,
"sampling/importance_sampling_ratio/min": 0.06851065363734961,
"sampling/sampling_logp_difference/max": 0.9137670040130615,
"sampling/sampling_logp_difference/mean": 0.004217420145869255,
"step": 10920,
"step_time": 8.734964791793027
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1570.8,
"completions/max_terminated_length": 1220.4,
"completions/mean_length": 151.357421875,
"completions/mean_terminated_length": 148.39171142578124,
"completions/min_length": 62.2,
"completions/min_terminated_length": 62.2,
"entropy": 0.039173580170609054,
"epoch": 23.404710920770878,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.907100000000002e-06,
"loss": -0.0071,
"num_tokens": 1095058440.0,
"reward": 1.0752734541893005,
"reward_std": 0.11650098711252213,
"rewards/reward_accuracy/mean": 0.975390625,
"rewards/reward_accuracy/std": 0.11580890119075775,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.0014512486523017287,
"sampling/importance_sampling_ratio/max": 2.447936475276947,
"sampling/importance_sampling_ratio/mean": 0.986094731092453,
"sampling/importance_sampling_ratio/min": 0.09639663547277451,
"sampling/sampling_logp_difference/max": 0.9480867505073547,
"sampling/sampling_logp_difference/mean": 0.003910442511551082,
"step": 10930,
"step_time": 7.296908667602111
},
{
"clip_ratio/high_max": 1.604878780199215e-05,
"clip_ratio/high_mean": 2.0060984752490186e-06,
"clip_ratio/low_mean": 2.695865555324417e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.701964144260273e-06,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1147.7,
"completions/max_terminated_length": 1133.2,
"completions/mean_length": 158.15078125,
"completions/mean_terminated_length": 147.79278411865235,
"completions/min_length": 67.6,
"completions/min_terminated_length": 67.6,
"entropy": 0.0404604691779241,
"epoch": 23.426124197002142,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.345703125,
"learning_rate": 8.906100000000001e-06,
"loss": -0.0062,
"num_tokens": 1095987466.0,
"reward": 1.0765039324760437,
"reward_std": 0.11481446549296379,
"rewards/reward_accuracy/mean": 0.976953125,
"rewards/reward_accuracy/std": 0.1130295068025589,
"rewards/reward_format/mean": 0.09955078288912773,
"rewards/reward_format/std": 0.0025877282954752446,
"sampling/importance_sampling_ratio/max": 2.526186490058899,
"sampling/importance_sampling_ratio/mean": 0.983789575099945,
"sampling/importance_sampling_ratio/min": 0.14546271711587905,
"sampling/sampling_logp_difference/max": 0.9572840452194213,
"sampling/sampling_logp_difference/mean": 0.00388468261808157,
"step": 10940,
"step_time": 5.888989588193363
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1075.1,
"completions/max_terminated_length": 979.1,
"completions/mean_length": 160.60078125,
"completions/mean_terminated_length": 156.2339599609375,
"completions/min_length": 61.5,
"completions/min_terminated_length": 61.5,
"entropy": 0.0464666236191988,
"epoch": 23.447537473233403,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.0,
"learning_rate": 8.9051e-06,
"loss": -0.0019,
"num_tokens": 1096912812.0,
"reward": 1.070878928899765,
"reward_std": 0.1293273739516735,
"rewards/reward_accuracy/mean": 0.97109375,
"rewards/reward_accuracy/std": 0.12787596136331558,
"rewards/reward_format/mean": 0.09978515654802322,
"rewards/reward_format/std": 0.002809226466342807,
"sampling/importance_sampling_ratio/max": 2.5104976892471313,
"sampling/importance_sampling_ratio/mean": 0.9785624563694,
"sampling/importance_sampling_ratio/min": 0.10366839617490768,
"sampling/sampling_logp_difference/max": 1.0844203233718872,
"sampling/sampling_logp_difference/mean": 0.00421791214030236,
"step": 10950,
"step_time": 5.52448411580699
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1345.5,
"completions/max_terminated_length": 1050.5,
"completions/mean_length": 153.190234375,
"completions/mean_terminated_length": 147.288134765625,
"completions/min_length": 67.4,
"completions/min_terminated_length": 67.4,
"entropy": 0.039204456261359155,
"epoch": 23.468950749464668,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.439453125,
"learning_rate": 8.904100000000002e-06,
"loss": 0.004,
"num_tokens": 1097828883.0,
"reward": 1.059082043170929,
"reward_std": 0.1676092892885208,
"rewards/reward_accuracy/mean": 0.959375,
"rewards/reward_accuracy/std": 0.1659950003027916,
"rewards/reward_format/mean": 0.09970703199505807,
"rewards/reward_format/std": 0.0029011272126808763,
"sampling/importance_sampling_ratio/max": 2.4927356004714967,
"sampling/importance_sampling_ratio/mean": 0.9915771603584289,
"sampling/importance_sampling_ratio/min": 0.22791349459439517,
"sampling/sampling_logp_difference/max": 0.9134122252464294,
"sampling/sampling_logp_difference/mean": 0.0038418916519731283,
"step": 10960,
"step_time": 6.377705751403118
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1366.9,
"completions/max_terminated_length": 1160.3,
"completions/mean_length": 161.371484375,
"completions/mean_terminated_length": 154.7718276977539,
"completions/min_length": 68.9,
"completions/min_terminated_length": 68.9,
"entropy": 0.037138220435008404,
"epoch": 23.490364025695932,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.74609375,
"learning_rate": 8.903100000000001e-06,
"loss": 0.0007,
"num_tokens": 1098767322.0,
"reward": 1.0673242330551147,
"reward_std": 0.14155592098832132,
"rewards/reward_accuracy/mean": 0.967578125,
"rewards/reward_accuracy/std": 0.14008449614048005,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.0025289240293204784,
"sampling/importance_sampling_ratio/max": 2.406995344161987,
"sampling/importance_sampling_ratio/mean": 0.9956981658935546,
"sampling/importance_sampling_ratio/min": 0.1746007665991783,
"sampling/sampling_logp_difference/max": 1.0382378458976746,
"sampling/sampling_logp_difference/mean": 0.003798506478779018,
"step": 10970,
"step_time": 6.6131220785871845
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 996.4,
"completions/max_terminated_length": 894.7,
"completions/mean_length": 150.741796875,
"completions/mean_terminated_length": 143.37058868408204,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.038746650354005395,
"epoch": 23.511777301927197,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.5625,
"learning_rate": 8.9021e-06,
"loss": 0.0009,
"num_tokens": 1099668341.0,
"reward": 1.0719726800918579,
"reward_std": 0.13068555146455765,
"rewards/reward_accuracy/mean": 0.972265625,
"rewards/reward_accuracy/std": 0.1295544534921646,
"rewards/reward_format/mean": 0.09970703274011612,
"rewards/reward_format/std": 0.0025811867089942098,
"sampling/importance_sampling_ratio/max": 2.489152228832245,
"sampling/importance_sampling_ratio/mean": 0.99608074426651,
"sampling/importance_sampling_ratio/min": 0.08760997373610735,
"sampling/sampling_logp_difference/max": 0.9916985273361206,
"sampling/sampling_logp_difference/mean": 0.0039536817464977505,
"step": 10980,
"step_time": 5.107928385314881
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1506.3,
"completions/max_terminated_length": 1037.8,
"completions/mean_length": 160.94765625,
"completions/mean_terminated_length": 151.3661087036133,
"completions/min_length": 69.7,
"completions/min_terminated_length": 69.7,
"entropy": 0.040650186361745,
"epoch": 23.533190578158457,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.9011e-06,
"loss": -0.009,
"num_tokens": 1100601231.0,
"reward": 1.0680078148841858,
"reward_std": 0.15167272314429284,
"rewards/reward_accuracy/mean": 0.968359375,
"rewards/reward_accuracy/std": 0.14980393052101135,
"rewards/reward_format/mean": 0.09964843764901161,
"rewards/reward_format/std": 0.0033994980156421663,
"sampling/importance_sampling_ratio/max": 2.3403989911079406,
"sampling/importance_sampling_ratio/mean": 0.9767226636409759,
"sampling/importance_sampling_ratio/min": 0.11855874918401241,
"sampling/sampling_logp_difference/max": 1.2521864473819733,
"sampling/sampling_logp_difference/mean": 0.003899585409089923,
"step": 10990,
"step_time": 7.181057873484678
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1779.4,
"completions/max_terminated_length": 1399.8,
"completions/mean_length": 175.63984375,
"completions/mean_terminated_length": 158.75332412719726,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.0530326524283737,
"epoch": 23.554603854389722,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.2158203125,
"learning_rate": 8.9001e-06,
"loss": 0.0043,
"num_tokens": 1101569429.0,
"reward": 1.0543555080890656,
"reward_std": 0.18259108811616898,
"rewards/reward_accuracy/mean": 0.955078125,
"rewards/reward_accuracy/std": 0.17899423092603683,
"rewards/reward_format/mean": 0.09927734732627869,
"rewards/reward_format/std": 0.0071779279038310054,
"sampling/importance_sampling_ratio/max": 2.6021832704544066,
"sampling/importance_sampling_ratio/mean": 0.9844517111778259,
"sampling/importance_sampling_ratio/min": 0.020998120587319136,
"sampling/sampling_logp_difference/max": 1.2735938429832458,
"sampling/sampling_logp_difference/mean": 0.004221199988387525,
"step": 11000,
"step_time": 8.869265718193493
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1363.3,
"completions/max_terminated_length": 1223.2,
"completions/mean_length": 162.16015625,
"completions/mean_terminated_length": 155.47667694091797,
"completions/min_length": 68.3,
"completions/min_terminated_length": 68.3,
"entropy": 0.03942415353376418,
"epoch": 23.576017130620986,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.54296875,
"learning_rate": 8.899100000000001e-06,
"loss": -0.0036,
"num_tokens": 1102505407.0,
"reward": 1.0554882884025574,
"reward_std": 0.17089750990271568,
"rewards/reward_accuracy/mean": 0.955859375,
"rewards/reward_accuracy/std": 0.16943742707371712,
"rewards/reward_format/mean": 0.09962890669703484,
"rewards/reward_format/std": 0.0037033478962257504,
"sampling/importance_sampling_ratio/max": 2.5082205057144167,
"sampling/importance_sampling_ratio/mean": 0.9943172812461853,
"sampling/importance_sampling_ratio/min": 0.12451257216744124,
"sampling/sampling_logp_difference/max": 1.1028799533843994,
"sampling/sampling_logp_difference/mean": 0.0037123991642147303,
"step": 11010,
"step_time": 6.705440358901979
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1352.0,
"completions/max_terminated_length": 1135.3,
"completions/mean_length": 164.19140625,
"completions/mean_terminated_length": 149.58389282226562,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.04184976443648338,
"epoch": 23.597430406852247,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.111328125,
"learning_rate": 8.8981e-06,
"loss": -0.0086,
"num_tokens": 1103442025.0,
"reward": 1.054960948228836,
"reward_std": 0.15164162919390947,
"rewards/reward_accuracy/mean": 0.95546875,
"rewards/reward_accuracy/std": 0.14957888051867485,
"rewards/reward_format/mean": 0.09949218854308128,
"rewards/reward_format/std": 0.004117446066811681,
"sampling/importance_sampling_ratio/max": 2.398791825771332,
"sampling/importance_sampling_ratio/mean": 0.9853086113929749,
"sampling/importance_sampling_ratio/min": 0.2199038863182068,
"sampling/sampling_logp_difference/max": 0.9183895885944366,
"sampling/sampling_logp_difference/mean": 0.003972168872132897,
"step": 11020,
"step_time": 6.641738192707999
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 5.183371877137688e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 5.183371877137688e-06,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1239.6,
"completions/max_terminated_length": 1122.8,
"completions/mean_length": 180.38984375,
"completions/mean_terminated_length": 161.45996704101563,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.05257895449176431,
"epoch": 23.61884368308351,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.244140625,
"learning_rate": 8.8971e-06,
"loss": -0.0018,
"num_tokens": 1104422719.0,
"reward": 1.0466797053813934,
"reward_std": 0.19722233191132546,
"rewards/reward_accuracy/mean": 0.94765625,
"rewards/reward_accuracy/std": 0.1935410089790821,
"rewards/reward_format/mean": 0.09902343824505806,
"rewards/reward_format/std": 0.005744448467157781,
"sampling/importance_sampling_ratio/max": 2.5008029103279115,
"sampling/importance_sampling_ratio/mean": 0.9732604503631592,
"sampling/importance_sampling_ratio/min": 0.14618988558650017,
"sampling/sampling_logp_difference/max": 1.0077753961086273,
"sampling/sampling_logp_difference/mean": 0.004200595780275762,
"step": 11030,
"step_time": 6.476664922892814
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1603.2,
"completions/max_terminated_length": 1171.0,
"completions/mean_length": 168.986328125,
"completions/mean_terminated_length": 159.4491973876953,
"completions/min_length": 63.9,
"completions/min_terminated_length": 63.9,
"entropy": 0.046191906463354825,
"epoch": 23.640256959314776,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.3359375,
"learning_rate": 8.896100000000001e-06,
"loss": -0.0073,
"num_tokens": 1105377564.0,
"reward": 1.0625781416893005,
"reward_std": 0.17440852224826814,
"rewards/reward_accuracy/mean": 0.962890625,
"rewards/reward_accuracy/std": 0.17263455763459207,
"rewards/reward_format/mean": 0.09968750104308129,
"rewards/reward_format/std": 0.003743039187975228,
"sampling/importance_sampling_ratio/max": 2.443726933002472,
"sampling/importance_sampling_ratio/mean": 0.9870038270950318,
"sampling/importance_sampling_ratio/min": 0.07340096213156358,
"sampling/sampling_logp_difference/max": 1.0454235434532166,
"sampling/sampling_logp_difference/mean": 0.00408145512919873,
"step": 11040,
"step_time": 7.6994130138045875
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1316.5,
"completions/max_terminated_length": 1024.7,
"completions/mean_length": 146.4828125,
"completions/mean_terminated_length": 142.0119873046875,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.04196287484373897,
"epoch": 23.661670235546037,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.8951e-06,
"loss": -0.0058,
"num_tokens": 1106269296.0,
"reward": 1.0704687595367433,
"reward_std": 0.12753385743126272,
"rewards/reward_accuracy/mean": 0.970703125,
"rewards/reward_accuracy/std": 0.12562455385923385,
"rewards/reward_format/mean": 0.09976562559604644,
"rewards/reward_format/std": 0.002769352635368705,
"sampling/importance_sampling_ratio/max": 2.4445254802703857,
"sampling/importance_sampling_ratio/mean": 0.9925706028938294,
"sampling/importance_sampling_ratio/min": 0.13774718046188356,
"sampling/sampling_logp_difference/max": 0.9800547897815705,
"sampling/sampling_logp_difference/mean": 0.0041548464680090545,
"step": 11050,
"step_time": 6.124498857671279
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.617565112610464e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.617565112610464e-06,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1099.3,
"completions/max_terminated_length": 667.5,
"completions/mean_length": 156.09921875,
"completions/mean_terminated_length": 140.55545654296876,
"completions/min_length": 63.2,
"completions/min_terminated_length": 63.2,
"entropy": 0.03794092582538724,
"epoch": 23.6830835117773,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.52734375,
"learning_rate": 8.894100000000002e-06,
"loss": -0.0009,
"num_tokens": 1107184414.0,
"reward": 1.0543945550918579,
"reward_std": 0.15666490867733956,
"rewards/reward_accuracy/mean": 0.955078125,
"rewards/reward_accuracy/std": 0.15472969487309457,
"rewards/reward_format/mean": 0.09931640774011612,
"rewards/reward_format/std": 0.0036534470040351153,
"sampling/importance_sampling_ratio/max": 2.431917703151703,
"sampling/importance_sampling_ratio/mean": 0.9858829736709595,
"sampling/importance_sampling_ratio/min": 0.07626010701060296,
"sampling/sampling_logp_difference/max": 0.9283371269702911,
"sampling/sampling_logp_difference/mean": 0.0038408170687034724,
"step": 11060,
"step_time": 5.714390689597349
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1440.2,
"completions/max_terminated_length": 1285.5,
"completions/mean_length": 155.4984375,
"completions/mean_terminated_length": 150.32837371826173,
"completions/min_length": 66.5,
"completions/min_terminated_length": 66.5,
"entropy": 0.04177339777816087,
"epoch": 23.704496788008566,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.5078125,
"learning_rate": 8.893100000000001e-06,
"loss": 0.0013,
"num_tokens": 1108102138.0,
"reward": 1.0695703506469727,
"reward_std": 0.14342869222164153,
"rewards/reward_accuracy/mean": 0.969921875,
"rewards/reward_accuracy/std": 0.14177748337388038,
"rewards/reward_format/mean": 0.09964843988418579,
"rewards/reward_format/std": 0.003718083677813411,
"sampling/importance_sampling_ratio/max": 2.5824814796447755,
"sampling/importance_sampling_ratio/mean": 0.9848661005496979,
"sampling/importance_sampling_ratio/min": 0.06376438941806555,
"sampling/sampling_logp_difference/max": 0.9110740065574646,
"sampling/sampling_logp_difference/mean": 0.003804513462819159,
"step": 11070,
"step_time": 7.004010394585203
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1623.6,
"completions/max_terminated_length": 1170.9,
"completions/mean_length": 157.52578125,
"completions/mean_terminated_length": 150.13490600585936,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.041903810622170565,
"epoch": 23.72591006423983,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.0,
"learning_rate": 8.8921e-06,
"loss": -0.0076,
"num_tokens": 1109023452.0,
"reward": 1.0590429902076721,
"reward_std": 0.16219698637723923,
"rewards/reward_accuracy/mean": 0.959375,
"rewards/reward_accuracy/std": 0.1605878584086895,
"rewards/reward_format/mean": 0.09966797009110451,
"rewards/reward_format/std": 0.003948523802682758,
"sampling/importance_sampling_ratio/max": 2.5127769470214845,
"sampling/importance_sampling_ratio/mean": 0.9874406814575195,
"sampling/importance_sampling_ratio/min": 0.0813139977864921,
"sampling/sampling_logp_difference/max": 1.0436568856239319,
"sampling/sampling_logp_difference/mean": 0.004000248573720455,
"step": 11080,
"step_time": 7.533294048914104
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1318.4,
"completions/max_terminated_length": 1163.7,
"completions/mean_length": 146.9640625,
"completions/mean_terminated_length": 142.52278900146484,
"completions/min_length": 63.5,
"completions/min_terminated_length": 63.5,
"entropy": 0.03813634992111474,
"epoch": 23.74732334047109,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.33203125,
"learning_rate": 8.8911e-06,
"loss": -0.0034,
"num_tokens": 1109914816.0,
"reward": 1.0837304830551147,
"reward_std": 0.09407670348882675,
"rewards/reward_accuracy/mean": 0.983984375,
"rewards/reward_accuracy/std": 0.09244493693113327,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.0027787382015958427,
"sampling/importance_sampling_ratio/max": 2.463629412651062,
"sampling/importance_sampling_ratio/mean": 0.9878502368927002,
"sampling/importance_sampling_ratio/min": 0.14623553305864334,
"sampling/sampling_logp_difference/max": 0.9443942546844483,
"sampling/sampling_logp_difference/mean": 0.003998776478692889,
"step": 11090,
"step_time": 6.4309308143885575
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1349.9,
"completions/max_terminated_length": 1222.3,
"completions/mean_length": 179.826171875,
"completions/mean_terminated_length": 169.67220916748047,
"completions/min_length": 65.2,
"completions/min_terminated_length": 65.2,
"entropy": 0.050054719136096534,
"epoch": 23.768736616702355,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0,
"learning_rate": 8.8901e-06,
"loss": -0.0067,
"num_tokens": 1110896227.0,
"reward": 1.0502539217472076,
"reward_std": 0.17934509366750717,
"rewards/reward_accuracy/mean": 0.95078125,
"rewards/reward_accuracy/std": 0.17742043286561965,
"rewards/reward_format/mean": 0.09947265684604645,
"rewards/reward_format/std": 0.004709987225942314,
"sampling/importance_sampling_ratio/max": 2.4439247012138368,
"sampling/importance_sampling_ratio/mean": 0.9787640392780304,
"sampling/importance_sampling_ratio/min": 0.05009023388847709,
"sampling/sampling_logp_difference/max": 1.0435368299484253,
"sampling/sampling_logp_difference/mean": 0.00413527365308255,
"step": 11100,
"step_time": 6.903354714126908
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 782.2,
"completions/max_terminated_length": 782.2,
"completions/mean_length": 138.392578125,
"completions/mean_terminated_length": 138.392578125,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"entropy": 0.03173546439502388,
"epoch": 23.79014989293362,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.0,
"learning_rate": 8.889100000000001e-06,
"loss": -0.0016,
"num_tokens": 1111766864.0,
"reward": 1.090234398841858,
"reward_std": 0.06089061126112938,
"rewards/reward_accuracy/mean": 0.990234375,
"rewards/reward_accuracy/std": 0.06089061424136162,
"rewards/reward_format/mean": 0.10000000149011612,
"rewards/reward_format/std": 0.0,
"sampling/importance_sampling_ratio/max": 2.325499784946442,
"sampling/importance_sampling_ratio/mean": 1.002909243106842,
"sampling/importance_sampling_ratio/min": 0.17281338274478913,
"sampling/sampling_logp_difference/max": 1.044821947813034,
"sampling/sampling_logp_difference/mean": 0.003530609677545726,
"step": 11110,
"step_time": 3.944817894499283
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 986.7,
"completions/max_terminated_length": 915.0,
"completions/mean_length": 144.553515625,
"completions/mean_terminated_length": 143.8144058227539,
"completions/min_length": 69.2,
"completions/min_terminated_length": 69.2,
"entropy": 0.036741185444407166,
"epoch": 23.81156316916488,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.193359375,
"learning_rate": 8.8881e-06,
"loss": -0.0038,
"num_tokens": 1112650505.0,
"reward": 1.0737109661102295,
"reward_std": 0.12624624148011207,
"rewards/reward_accuracy/mean": 0.973828125,
"rewards/reward_accuracy/std": 0.125871242582798,
"rewards/reward_format/mean": 0.09988281428813935,
"rewards/reward_format/std": 0.0012040342669934034,
"sampling/importance_sampling_ratio/max": 2.3627851963043214,
"sampling/importance_sampling_ratio/mean": 0.9817626535892486,
"sampling/importance_sampling_ratio/min": 0.2103845365345478,
"sampling/sampling_logp_difference/max": 1.0793030083179473,
"sampling/sampling_logp_difference/mean": 0.0037275390699505807,
"step": 11120,
"step_time": 4.907733045591158
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1227.6,
"completions/max_terminated_length": 1048.3,
"completions/mean_length": 142.83671875,
"completions/mean_terminated_length": 141.34096984863282,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.03857232332229614,
"epoch": 23.832976445396145,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.142578125,
"learning_rate": 8.8871e-06,
"loss": -0.0076,
"num_tokens": 1113525319.0,
"reward": 1.079101574420929,
"reward_std": 0.09802653552033007,
"rewards/reward_accuracy/mean": 0.979296875,
"rewards/reward_accuracy/std": 0.0966266855597496,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.002517323032952845,
"sampling/importance_sampling_ratio/max": 2.234272599220276,
"sampling/importance_sampling_ratio/mean": 0.9834360003471374,
"sampling/importance_sampling_ratio/min": 0.159623421728611,
"sampling/sampling_logp_difference/max": 0.9522471129894257,
"sampling/sampling_logp_difference/mean": 0.0038424851838499306,
"step": 11130,
"step_time": 5.945481015904806
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1563.8,
"completions/max_terminated_length": 1357.5,
"completions/mean_length": 154.815625,
"completions/mean_terminated_length": 148.90126419067383,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.041172755882143974,
"epoch": 23.85438972162741,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.306640625,
"learning_rate": 8.886100000000001e-06,
"loss": -0.0078,
"num_tokens": 1114446111.0,
"reward": 1.0662304759025574,
"reward_std": 0.1590818464756012,
"rewards/reward_accuracy/mean": 0.96640625,
"rewards/reward_accuracy/std": 0.15822510719299315,
"rewards/reward_format/mean": 0.09982421919703484,
"rewards/reward_format/std": 0.002015778259374201,
"sampling/importance_sampling_ratio/max": 2.4685360312461855,
"sampling/importance_sampling_ratio/mean": 0.9800400674343109,
"sampling/importance_sampling_ratio/min": 0.14294949658215045,
"sampling/sampling_logp_difference/max": 1.1478582859039306,
"sampling/sampling_logp_difference/mean": 0.00417276204098016,
"step": 11140,
"step_time": 7.247734551512986
},
{
"clip_ratio/high_max": 7.62939453125e-06,
"clip_ratio/high_mean": 9.5367431640625e-07,
"clip_ratio/low_mean": 3.814697265625e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.33514404296875e-06,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1391.1,
"completions/max_terminated_length": 1350.4,
"completions/mean_length": 165.958984375,
"completions/mean_terminated_length": 148.464306640625,
"completions/min_length": 68.7,
"completions/min_terminated_length": 68.7,
"entropy": 0.04879053947515786,
"epoch": 23.87580299785867,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.171875,
"learning_rate": 8.8851e-06,
"loss": -0.0038,
"num_tokens": 1115392406.0,
"reward": 1.057519543170929,
"reward_std": 0.15970769822597503,
"rewards/reward_accuracy/mean": 0.958203125,
"rewards/reward_accuracy/std": 0.15746156722307206,
"rewards/reward_format/mean": 0.09931640699505806,
"rewards/reward_format/std": 0.004003279306925833,
"sampling/importance_sampling_ratio/max": 2.4986698627471924,
"sampling/importance_sampling_ratio/mean": 0.9923582136631012,
"sampling/importance_sampling_ratio/min": 0.08487304151058198,
"sampling/sampling_logp_difference/max": 1.1141491413116456,
"sampling/sampling_logp_difference/mean": 0.004422889230772853,
"step": 11150,
"step_time": 6.902352834900375
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1293.3,
"completions/max_terminated_length": 1109.1,
"completions/mean_length": 148.9828125,
"completions/mean_terminated_length": 144.55226440429686,
"completions/min_length": 63.1,
"completions/min_terminated_length": 63.1,
"entropy": 0.03939378864597529,
"epoch": 23.897216274089935,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.51171875,
"learning_rate": 8.884100000000002e-06,
"loss": -0.0041,
"num_tokens": 1116287162.0,
"reward": 1.0790625035762786,
"reward_std": 0.11052702888846397,
"rewards/reward_accuracy/mean": 0.979296875,
"rewards/reward_accuracy/std": 0.10936770513653755,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0025854269508272408,
"sampling/importance_sampling_ratio/max": 2.5072956681251526,
"sampling/importance_sampling_ratio/mean": 0.9900150895118713,
"sampling/importance_sampling_ratio/min": 0.11248030923306943,
"sampling/sampling_logp_difference/max": 1.0090086579322814,
"sampling/sampling_logp_difference/mean": 0.004034120030701161,
"step": 11160,
"step_time": 6.176008862012532
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.010546875,
"completions/max_length": 1290.3,
"completions/max_terminated_length": 1007.3,
"completions/mean_length": 184.080859375,
"completions/mean_terminated_length": 164.6131233215332,
"completions/min_length": 62.7,
"completions/min_terminated_length": 62.7,
"entropy": 0.048549994663335386,
"epoch": 23.9186295503212,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.09619140625,
"learning_rate": 8.883100000000001e-06,
"loss": -0.0002,
"num_tokens": 1117275577.0,
"reward": 1.0503906428813934,
"reward_std": 0.17456183284521104,
"rewards/reward_accuracy/mean": 0.951171875,
"rewards/reward_accuracy/std": 0.17192681282758712,
"rewards/reward_format/mean": 0.09921875149011612,
"rewards/reward_format/std": 0.005085866758599877,
"sampling/importance_sampling_ratio/max": 2.508208441734314,
"sampling/importance_sampling_ratio/mean": 0.9767674565315246,
"sampling/importance_sampling_ratio/min": 0.11537059992551804,
"sampling/sampling_logp_difference/max": 0.9350176632404328,
"sampling/sampling_logp_difference/mean": 0.004001120803877711,
"step": 11170,
"step_time": 6.59816316178767
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1359.1,
"completions/max_terminated_length": 964.5,
"completions/mean_length": 148.005859375,
"completions/mean_terminated_length": 141.36044311523438,
"completions/min_length": 61.7,
"completions/min_terminated_length": 61.7,
"entropy": 0.04223037511110306,
"epoch": 23.940042826552464,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.255859375,
"learning_rate": 8.882100000000001e-06,
"loss": 0.0035,
"num_tokens": 1118164712.0,
"reward": 1.0786328315734863,
"reward_std": 0.102219720184803,
"rewards/reward_accuracy/mean": 0.97890625,
"rewards/reward_accuracy/std": 0.10063624382019043,
"rewards/reward_format/mean": 0.0997265636920929,
"rewards/reward_format/std": 0.003210427053272724,
"sampling/importance_sampling_ratio/max": 2.552950048446655,
"sampling/importance_sampling_ratio/mean": 0.9818095922470093,
"sampling/importance_sampling_ratio/min": 0.20733647122979165,
"sampling/sampling_logp_difference/max": 0.9639122247695923,
"sampling/sampling_logp_difference/mean": 0.004070730810053646,
"step": 11180,
"step_time": 6.666036998602794
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1470.7,
"completions/max_terminated_length": 1327.3,
"completions/mean_length": 166.584375,
"completions/mean_terminated_length": 150.4854934692383,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.04431672901846469,
"epoch": 23.961456102783725,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.8811e-06,
"loss": -0.0025,
"num_tokens": 1119106416.0,
"reward": 1.0477734625339508,
"reward_std": 0.17933609932661057,
"rewards/reward_accuracy/mean": 0.9484375,
"rewards/reward_accuracy/std": 0.17692701667547225,
"rewards/reward_format/mean": 0.0993359386920929,
"rewards/reward_format/std": 0.004545474913902581,
"sampling/importance_sampling_ratio/max": 2.3778921961784363,
"sampling/importance_sampling_ratio/mean": 0.9898649036884308,
"sampling/importance_sampling_ratio/min": 0.09477044369559735,
"sampling/sampling_logp_difference/max": 0.9656681299209595,
"sampling/sampling_logp_difference/mean": 0.004163624625653029,
"step": 11190,
"step_time": 7.265265255694976
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1610.9,
"completions/max_terminated_length": 1130.9,
"completions/mean_length": 164.656640625,
"completions/mean_terminated_length": 155.1536102294922,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"entropy": 0.042583665787242354,
"epoch": 23.98286937901499,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.2470703125,
"learning_rate": 8.8801e-06,
"loss": -0.0037,
"num_tokens": 1120045713.0,
"reward": 1.0777148842811584,
"reward_std": 0.12464412748813629,
"rewards/reward_accuracy/mean": 0.978125,
"rewards/reward_accuracy/std": 0.12253900617361069,
"rewards/reward_format/mean": 0.09958984553813935,
"rewards/reward_format/std": 0.004293221514672041,
"sampling/importance_sampling_ratio/max": 2.5059411406517027,
"sampling/importance_sampling_ratio/mean": 0.9858020365238189,
"sampling/importance_sampling_ratio/min": 0.13678931463509797,
"sampling/sampling_logp_difference/max": 0.8702320337295533,
"sampling/sampling_logp_difference/mean": 0.00422939972486347,
"step": 11200,
"step_time": 7.652190715601319
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.3836340460547945e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.3836340460547945e-06,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1437.0,
"completions/max_terminated_length": 1381.9,
"completions/mean_length": 174.031640625,
"completions/mean_terminated_length": 155.86766662597657,
"completions/min_length": 64.7,
"completions/min_terminated_length": 64.7,
"entropy": 0.047041116072796284,
"epoch": 24.004282655246254,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.1904296875,
"learning_rate": 8.879100000000001e-06,
"loss": -0.0098,
"num_tokens": 1121023266.0,
"reward": 1.0577343940734862,
"reward_std": 0.170895803719759,
"rewards/reward_accuracy/mean": 0.95859375,
"rewards/reward_accuracy/std": 0.16767879575490952,
"rewards/reward_format/mean": 0.09914062619209289,
"rewards/reward_format/std": 0.005854570795781911,
"sampling/importance_sampling_ratio/max": 2.586548638343811,
"sampling/importance_sampling_ratio/mean": 0.9834637582302094,
"sampling/importance_sampling_ratio/min": 0.03872371180914343,
"sampling/sampling_logp_difference/max": 1.030207920074463,
"sampling/sampling_logp_difference/mean": 0.004248480685055256,
"step": 11210,
"step_time": 7.457519799182774
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1495.1,
"completions/max_terminated_length": 1237.8,
"completions/mean_length": 159.40390625,
"completions/mean_terminated_length": 149.74846496582032,
"completions/min_length": 67.8,
"completions/min_terminated_length": 67.8,
"entropy": 0.043850741372443734,
"epoch": 24.025695931477514,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.057373046875,
"learning_rate": 8.8781e-06,
"loss": -0.0054,
"num_tokens": 1121947436.0,
"reward": 1.0789257884025574,
"reward_std": 0.09665778279304504,
"rewards/reward_accuracy/mean": 0.979296875,
"rewards/reward_accuracy/std": 0.09441059231758117,
"rewards/reward_format/mean": 0.09962890669703484,
"rewards/reward_format/std": 0.003959212452173233,
"sampling/importance_sampling_ratio/max": 2.3573970556259156,
"sampling/importance_sampling_ratio/mean": 0.9892006158828736,
"sampling/importance_sampling_ratio/min": 0.061054366454482076,
"sampling/sampling_logp_difference/max": 0.8471563458442688,
"sampling/sampling_logp_difference/mean": 0.004097235109657049,
"step": 11220,
"step_time": 7.162904961113236
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1512.6,
"completions/max_terminated_length": 1252.5,
"completions/mean_length": 154.504296875,
"completions/mean_terminated_length": 151.55391693115234,
"completions/min_length": 64.4,
"completions/min_terminated_length": 64.4,
"entropy": 0.04455705943983048,
"epoch": 24.04710920770878,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.8771e-06,
"loss": -0.0015,
"num_tokens": 1122859031.0,
"reward": 1.0565624952316284,
"reward_std": 0.18371452689170836,
"rewards/reward_accuracy/mean": 0.956640625,
"rewards/reward_accuracy/std": 0.18355250209569932,
"rewards/reward_format/mean": 0.09992187470197678,
"rewards/reward_format/std": 0.0012500000186264515,
"sampling/importance_sampling_ratio/max": 2.5235920906066895,
"sampling/importance_sampling_ratio/mean": 0.9860525250434875,
"sampling/importance_sampling_ratio/min": 0.14331450462341308,
"sampling/sampling_logp_difference/max": 0.9227908194065094,
"sampling/sampling_logp_difference/mean": 0.004219663701951504,
"step": 11230,
"step_time": 7.3107676549989264
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1360.6,
"completions/max_terminated_length": 1247.4,
"completions/mean_length": 150.311328125,
"completions/mean_terminated_length": 145.94015579223634,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.03721710245590657,
"epoch": 24.068522483940043,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.451171875,
"learning_rate": 8.876100000000001e-06,
"loss": -0.0034,
"num_tokens": 1123761556.0,
"reward": 1.0829492330551147,
"reward_std": 0.08793287500739097,
"rewards/reward_accuracy/mean": 0.983203125,
"rewards/reward_accuracy/std": 0.08695978224277497,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.0024806494591757657,
"sampling/importance_sampling_ratio/max": 2.451358771324158,
"sampling/importance_sampling_ratio/mean": 0.9804857611656189,
"sampling/importance_sampling_ratio/min": 0.11001214757561684,
"sampling/sampling_logp_difference/max": 0.9100097060203552,
"sampling/sampling_logp_difference/mean": 0.0036036816658452154,
"step": 11240,
"step_time": 6.644301971493405
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1359.9,
"completions/max_terminated_length": 1182.2,
"completions/mean_length": 159.83359375,
"completions/mean_terminated_length": 150.32230224609376,
"completions/min_length": 61.3,
"completions/min_terminated_length": 61.3,
"entropy": 0.04503620641771704,
"epoch": 24.089935760171308,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0,
"learning_rate": 8.8751e-06,
"loss": 0.0017,
"num_tokens": 1124684538.0,
"reward": 1.0672265887260437,
"reward_std": 0.14864370077848435,
"rewards/reward_accuracy/mean": 0.967578125,
"rewards/reward_accuracy/std": 0.14695805236697196,
"rewards/reward_format/mean": 0.09964843839406967,
"rewards/reward_format/std": 0.003013067995198071,
"sampling/importance_sampling_ratio/max": 2.5980422258377076,
"sampling/importance_sampling_ratio/mean": 0.9915215015411377,
"sampling/importance_sampling_ratio/min": 0.16659798808395862,
"sampling/sampling_logp_difference/max": 1.067195439338684,
"sampling/sampling_logp_difference/mean": 0.004121610126458108,
"step": 11250,
"step_time": 6.685319401300513
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1466.6,
"completions/max_terminated_length": 1233.3,
"completions/mean_length": 161.57265625,
"completions/mean_terminated_length": 156.4506103515625,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.04742241476196796,
"epoch": 24.11134903640257,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0576171875,
"learning_rate": 8.8741e-06,
"loss": -0.0054,
"num_tokens": 1125615172.0,
"reward": 1.064453136920929,
"reward_std": 0.15274179577827454,
"rewards/reward_accuracy/mean": 0.96484375,
"rewards/reward_accuracy/std": 0.15025445744395255,
"rewards/reward_format/mean": 0.09960937574505806,
"rewards/reward_format/std": 0.0035739872371777894,
"sampling/importance_sampling_ratio/max": 2.5137549519538878,
"sampling/importance_sampling_ratio/mean": 1.0018266677856444,
"sampling/importance_sampling_ratio/min": 0.05381937548518181,
"sampling/sampling_logp_difference/max": 1.1690970361232758,
"sampling/sampling_logp_difference/mean": 0.004173097806051374,
"step": 11260,
"step_time": 7.093306594592287
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1016.4,
"completions/max_terminated_length": 938.4,
"completions/mean_length": 158.897265625,
"completions/mean_terminated_length": 151.57401580810546,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.03667430775240064,
"epoch": 24.132762312633833,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.302734375,
"learning_rate": 8.873100000000001e-06,
"loss": -0.007,
"num_tokens": 1126545245.0,
"reward": 1.0598632931709289,
"reward_std": 0.17501015737652778,
"rewards/reward_accuracy/mean": 0.96015625,
"rewards/reward_accuracy/std": 0.17353033795952796,
"rewards/reward_format/mean": 0.09970703199505807,
"rewards/reward_format/std": 0.002456712001003325,
"sampling/importance_sampling_ratio/max": 2.3034071207046507,
"sampling/importance_sampling_ratio/mean": 0.9699432134628296,
"sampling/importance_sampling_ratio/min": 0.12411474715918303,
"sampling/sampling_logp_difference/max": 1.3517356097698212,
"sampling/sampling_logp_difference/mean": 0.003768257098272443,
"step": 11270,
"step_time": 5.341649062206852
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1240.1,
"completions/max_terminated_length": 978.8,
"completions/mean_length": 160.05390625,
"completions/mean_terminated_length": 150.5116424560547,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"entropy": 0.04413228172343224,
"epoch": 24.154175588865098,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.0,
"learning_rate": 8.872100000000001e-06,
"loss": -0.0099,
"num_tokens": 1127470519.0,
"reward": 1.0660742402076722,
"reward_std": 0.157289270311594,
"rewards/reward_accuracy/mean": 0.96640625,
"rewards/reward_accuracy/std": 0.1555299885571003,
"rewards/reward_format/mean": 0.09966796934604645,
"rewards/reward_format/std": 0.003259230894036591,
"sampling/importance_sampling_ratio/max": 2.487817716598511,
"sampling/importance_sampling_ratio/mean": 0.9870866656303405,
"sampling/importance_sampling_ratio/min": 0.1466987870633602,
"sampling/sampling_logp_difference/max": 1.1003339290618896,
"sampling/sampling_logp_difference/mean": 0.003948561614379287,
"step": 11280,
"step_time": 6.18819140829437
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 1649.3,
"completions/max_terminated_length": 1439.5,
"completions/mean_length": 183.2984375,
"completions/mean_terminated_length": 161.6865249633789,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"entropy": 0.049460954428650436,
"epoch": 24.17558886509636,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.23828125,
"learning_rate": 8.8711e-06,
"loss": -0.006,
"num_tokens": 1128461651.0,
"reward": 1.0480859518051147,
"reward_std": 0.1834425561130047,
"rewards/reward_accuracy/mean": 0.94921875,
"rewards/reward_accuracy/std": 0.1801126070320606,
"rewards/reward_format/mean": 0.09886718690395355,
"rewards/reward_format/std": 0.007458450389094651,
"sampling/importance_sampling_ratio/max": 2.5265305995941163,
"sampling/importance_sampling_ratio/mean": 0.9735988736152649,
"sampling/importance_sampling_ratio/min": 0.06479968652129173,
"sampling/sampling_logp_difference/max": 1.476983404159546,
"sampling/sampling_logp_difference/mean": 0.004262510919943452,
"step": 11290,
"step_time": 8.080988564083237
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 1401.4,
"completions/max_terminated_length": 1268.2,
"completions/mean_length": 173.533984375,
"completions/mean_terminated_length": 151.5237808227539,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.045092773204669354,
"epoch": 24.197002141327623,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.3359375,
"learning_rate": 8.8701e-06,
"loss": -0.0075,
"num_tokens": 1129421770.0,
"reward": 1.0593359649181366,
"reward_std": 0.14787585958838462,
"rewards/reward_accuracy/mean": 0.96015625,
"rewards/reward_accuracy/std": 0.144665115326643,
"rewards/reward_format/mean": 0.09917968884110451,
"rewards/reward_format/std": 0.0058933463878929615,
"sampling/importance_sampling_ratio/max": 2.4996002912521362,
"sampling/importance_sampling_ratio/mean": 0.9737937450408936,
"sampling/importance_sampling_ratio/min": 0.0822089347988367,
"sampling/sampling_logp_difference/max": 1.6859662711620331,
"sampling/sampling_logp_difference/mean": 0.004071234283037484,
"step": 11300,
"step_time": 6.9138110715925
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1039.2,
"completions/max_terminated_length": 900.2,
"completions/mean_length": 151.159765625,
"completions/mean_terminated_length": 148.21360931396484,
"completions/min_length": 70.3,
"completions/min_terminated_length": 70.3,
"entropy": 0.037229006015695634,
"epoch": 24.218415417558887,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.869100000000001e-06,
"loss": -0.0053,
"num_tokens": 1130331363.0,
"reward": 1.046367210149765,
"reward_std": 0.16001750528812408,
"rewards/reward_accuracy/mean": 0.946484375,
"rewards/reward_accuracy/std": 0.15956772044301032,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.001476639206521213,
"sampling/importance_sampling_ratio/max": 2.41105717420578,
"sampling/importance_sampling_ratio/mean": 0.9968326449394226,
"sampling/importance_sampling_ratio/min": 0.058649804443120956,
"sampling/sampling_logp_difference/max": 1.1402732312679291,
"sampling/sampling_logp_difference/mean": 0.0037118569016456604,
"step": 11310,
"step_time": 5.345810765284114
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1256.6,
"completions/max_terminated_length": 1118.2,
"completions/mean_length": 156.36796875,
"completions/mean_terminated_length": 151.24252014160157,
"completions/min_length": 67.2,
"completions/min_terminated_length": 67.2,
"entropy": 0.03905292795971036,
"epoch": 24.239828693790148,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.0,
"learning_rate": 8.8681e-06,
"loss": -0.0085,
"num_tokens": 1131250129.0,
"reward": 1.074316418170929,
"reward_std": 0.1285008780658245,
"rewards/reward_accuracy/mean": 0.974609375,
"rewards/reward_accuracy/std": 0.12737578973174096,
"rewards/reward_format/mean": 0.09970703199505807,
"rewards/reward_format/std": 0.002270259871147573,
"sampling/importance_sampling_ratio/max": 2.5893158197402952,
"sampling/importance_sampling_ratio/mean": 0.9861358821392059,
"sampling/importance_sampling_ratio/min": 0.13645622874610125,
"sampling/sampling_logp_difference/max": 0.9953464090824127,
"sampling/sampling_logp_difference/mean": 0.0037953846622258425,
"step": 11320,
"step_time": 6.091311311401659
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1284.2,
"completions/max_terminated_length": 1027.3,
"completions/mean_length": 149.8765625,
"completions/mean_terminated_length": 142.53687744140626,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.03912699436768889,
"epoch": 24.261241970021413,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.341796875,
"learning_rate": 8.8671e-06,
"loss": -0.0043,
"num_tokens": 1132151813.0,
"reward": 1.0700195670127868,
"reward_std": 0.1236156016588211,
"rewards/reward_accuracy/mean": 0.9703125,
"rewards/reward_accuracy/std": 0.12235691845417022,
"rewards/reward_format/mean": 0.09970703348517418,
"rewards/reward_format/std": 0.003323523700237274,
"sampling/importance_sampling_ratio/max": 2.384758973121643,
"sampling/importance_sampling_ratio/mean": 0.9900562584400177,
"sampling/importance_sampling_ratio/min": 0.17584608867764473,
"sampling/sampling_logp_difference/max": 1.047877848148346,
"sampling/sampling_logp_difference/mean": 0.004113761172629893,
"step": 11330,
"step_time": 6.303347544310964
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1035.0,
"completions/max_terminated_length": 993.5,
"completions/mean_length": 161.148828125,
"completions/mean_terminated_length": 158.20103759765624,
"completions/min_length": 67.4,
"completions/min_terminated_length": 67.4,
"entropy": 0.038834403781220314,
"epoch": 24.282655246252677,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.2197265625,
"learning_rate": 8.866100000000001e-06,
"loss": -0.0008,
"num_tokens": 1133084210.0,
"reward": 1.0481836140155791,
"reward_std": 0.17314860075712205,
"rewards/reward_accuracy/mean": 0.9484375,
"rewards/reward_accuracy/std": 0.17210859134793283,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.002755774348042905,
"sampling/importance_sampling_ratio/max": 2.4803681492805483,
"sampling/importance_sampling_ratio/mean": 0.9996186137199402,
"sampling/importance_sampling_ratio/min": 0.16266994923353195,
"sampling/sampling_logp_difference/max": 0.9546588122844696,
"sampling/sampling_logp_difference/mean": 0.0037512956652790306,
"step": 11340,
"step_time": 5.199755921988981
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.0800709560498944e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.0800709560498944e-06,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1364.9,
"completions/max_terminated_length": 1085.9,
"completions/mean_length": 161.601953125,
"completions/mean_terminated_length": 146.76844482421876,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.04281568368896842,
"epoch": 24.30406852248394,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.302734375,
"learning_rate": 8.865100000000001e-06,
"loss": -0.0069,
"num_tokens": 1134016119.0,
"reward": 1.0800195336341858,
"reward_std": 0.11807377189397812,
"rewards/reward_accuracy/mean": 0.98046875,
"rewards/reward_accuracy/std": 0.11608680114150047,
"rewards/reward_format/mean": 0.0995507813990116,
"rewards/reward_format/std": 0.0035629834746941924,
"sampling/importance_sampling_ratio/max": 2.386510944366455,
"sampling/importance_sampling_ratio/mean": 0.979901123046875,
"sampling/importance_sampling_ratio/min": 0.11294109271839262,
"sampling/sampling_logp_difference/max": 0.8750439763069153,
"sampling/sampling_logp_difference/mean": 0.004006294230930507,
"step": 11350,
"step_time": 6.668037988207653
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1282.7,
"completions/max_terminated_length": 1189.6,
"completions/mean_length": 158.241796875,
"completions/mean_terminated_length": 152.37358551025392,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.04340752603020519,
"epoch": 24.325481798715202,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.8641e-06,
"loss": -0.0064,
"num_tokens": 1134942482.0,
"reward": 1.065722692012787,
"reward_std": 0.15205697119235992,
"rewards/reward_accuracy/mean": 0.966015625,
"rewards/reward_accuracy/std": 0.15085126236081123,
"rewards/reward_format/mean": 0.09970703348517418,
"rewards/reward_format/std": 0.002706968877464533,
"sampling/importance_sampling_ratio/max": 2.363619792461395,
"sampling/importance_sampling_ratio/mean": 0.9926375150680542,
"sampling/importance_sampling_ratio/min": 0.1334843583405018,
"sampling/sampling_logp_difference/max": 0.9427437901496887,
"sampling/sampling_logp_difference/mean": 0.004120607837103307,
"step": 11360,
"step_time": 6.421077870790032
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1327.3,
"completions/max_terminated_length": 1148.2,
"completions/mean_length": 152.353125,
"completions/mean_terminated_length": 147.92412109375,
"completions/min_length": 64.4,
"completions/min_terminated_length": 64.4,
"entropy": 0.04256524010561406,
"epoch": 24.346895074946467,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.07421875,
"learning_rate": 8.863100000000002e-06,
"loss": -0.006,
"num_tokens": 1135849738.0,
"reward": 1.0720703244209289,
"reward_std": 0.13395633772015572,
"rewards/reward_accuracy/mean": 0.972265625,
"rewards/reward_accuracy/std": 0.13294653743505477,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.002255769143812358,
"sampling/importance_sampling_ratio/max": 2.5542791366577147,
"sampling/importance_sampling_ratio/mean": 0.9920238435268403,
"sampling/importance_sampling_ratio/min": 0.10739230066537857,
"sampling/sampling_logp_difference/max": 0.9737458884716034,
"sampling/sampling_logp_difference/mean": 0.004130429262295366,
"step": 11370,
"step_time": 6.518625969186542
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1478.2,
"completions/max_terminated_length": 1279.2,
"completions/mean_length": 169.4703125,
"completions/mean_terminated_length": 161.5144775390625,
"completions/min_length": 62.4,
"completions/min_terminated_length": 62.4,
"entropy": 0.0452578985830769,
"epoch": 24.36830835117773,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.51171875,
"learning_rate": 8.862100000000001e-06,
"loss": -0.0041,
"num_tokens": 1136805998.0,
"reward": 1.0625390887260437,
"reward_std": 0.1601884499192238,
"rewards/reward_accuracy/mean": 0.962890625,
"rewards/reward_accuracy/std": 0.15836857110261918,
"rewards/reward_format/mean": 0.09964843913912773,
"rewards/reward_format/std": 0.003859223937615752,
"sampling/importance_sampling_ratio/max": 2.4385568857192994,
"sampling/importance_sampling_ratio/mean": 0.9945581376552581,
"sampling/importance_sampling_ratio/min": 0.1721921253949404,
"sampling/sampling_logp_difference/max": 0.8813803315162658,
"sampling/sampling_logp_difference/mean": 0.00407269683200866,
"step": 11380,
"step_time": 7.178502290215692
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 701.1,
"completions/max_terminated_length": 695.6,
"completions/mean_length": 144.564453125,
"completions/mean_terminated_length": 140.1809295654297,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.03848972299601883,
"epoch": 24.389721627408992,
"frac_reward_zero_std": 0.96875,
"grad_norm": 0.5,
"learning_rate": 8.8611e-06,
"loss": 0.0011,
"num_tokens": 1137689171.0,
"reward": 1.0811328291893005,
"reward_std": 0.08967520296573639,
"rewards/reward_accuracy/mean": 0.98125,
"rewards/reward_accuracy/std": 0.08912994116544723,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.0009831610135734082,
"sampling/importance_sampling_ratio/max": 2.385697436332703,
"sampling/importance_sampling_ratio/mean": 0.9890816450119019,
"sampling/importance_sampling_ratio/min": 0.22300620898604392,
"sampling/sampling_logp_difference/max": 0.9219032526016235,
"sampling/sampling_logp_difference/mean": 0.003769061784259975,
"step": 11390,
"step_time": 3.9188174475013513
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 963.5,
"completions/max_terminated_length": 898.5,
"completions/mean_length": 147.196484375,
"completions/mean_terminated_length": 145.00835418701172,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.03609990812838078,
"epoch": 24.411134903640257,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.33984375,
"learning_rate": 8.8601e-06,
"loss": -0.0027,
"num_tokens": 1138582746.0,
"reward": 1.0807422161102296,
"reward_std": 0.11001671701669694,
"rewards/reward_accuracy/mean": 0.980859375,
"rewards/reward_accuracy/std": 0.10910149067640304,
"rewards/reward_format/mean": 0.09988281428813935,
"rewards/reward_format/std": 0.0013232229743152858,
"sampling/importance_sampling_ratio/max": 2.482818531990051,
"sampling/importance_sampling_ratio/mean": 0.992947107553482,
"sampling/importance_sampling_ratio/min": 0.1123675525188446,
"sampling/sampling_logp_difference/max": 0.98158118724823,
"sampling/sampling_logp_difference/mean": 0.003677702369168401,
"step": 11400,
"step_time": 4.8423357605846835
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1053.5,
"completions/max_terminated_length": 897.5,
"completions/mean_length": 152.1453125,
"completions/mean_terminated_length": 150.66837463378906,
"completions/min_length": 64.7,
"completions/min_terminated_length": 64.7,
"entropy": 0.0362132816342637,
"epoch": 24.43254817987152,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.1435546875,
"learning_rate": 8.859100000000001e-06,
"loss": -0.0024,
"num_tokens": 1139486270.0,
"reward": 1.0718164205551148,
"reward_std": 0.11685862839221954,
"rewards/reward_accuracy/mean": 0.971875,
"rewards/reward_accuracy/std": 0.11668286249041557,
"rewards/reward_format/mean": 0.09994140639901161,
"rewards/reward_format/std": 0.0009375000139698386,
"sampling/importance_sampling_ratio/max": 2.367941689491272,
"sampling/importance_sampling_ratio/mean": 0.9896826982498169,
"sampling/importance_sampling_ratio/min": 0.1806713730096817,
"sampling/sampling_logp_difference/max": 0.9182133615016937,
"sampling/sampling_logp_difference/mean": 0.003704636846669018,
"step": 11410,
"step_time": 5.094782758012298
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1752.2,
"completions/max_terminated_length": 1368.4,
"completions/mean_length": 185.2640625,
"completions/mean_terminated_length": 169.1673599243164,
"completions/min_length": 67.6,
"completions/min_terminated_length": 67.6,
"entropy": 0.05177674910519272,
"epoch": 24.453961456102785,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.7265625,
"learning_rate": 8.8581e-06,
"loss": -0.0027,
"num_tokens": 1140481138.0,
"reward": 1.0547266006469727,
"reward_std": 0.18395565450191498,
"rewards/reward_accuracy/mean": 0.95546875,
"rewards/reward_accuracy/std": 0.18100138753652573,
"rewards/reward_format/mean": 0.0992578148841858,
"rewards/reward_format/std": 0.005668863817118108,
"sampling/importance_sampling_ratio/max": 2.4326607465744017,
"sampling/importance_sampling_ratio/mean": 0.9609059154987335,
"sampling/importance_sampling_ratio/min": 0.05753031224012375,
"sampling/sampling_logp_difference/max": 1.234291660785675,
"sampling/sampling_logp_difference/mean": 0.0044543516589328645,
"step": 11420,
"step_time": 8.36930659020436
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1367.4,
"completions/max_terminated_length": 1052.5,
"completions/mean_length": 167.21171875,
"completions/mean_terminated_length": 161.36723937988282,
"completions/min_length": 68.7,
"completions/min_terminated_length": 68.7,
"entropy": 0.04101451146416366,
"epoch": 24.475374732334046,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.2578125,
"learning_rate": 8.8571e-06,
"loss": 0.0015,
"num_tokens": 1141426848.0,
"reward": 1.0658007979393005,
"reward_std": 0.14964647293090821,
"rewards/reward_accuracy/mean": 0.966015625,
"rewards/reward_accuracy/std": 0.14811307787895203,
"rewards/reward_format/mean": 0.09978515729308128,
"rewards/reward_format/std": 0.002513692481443286,
"sampling/importance_sampling_ratio/max": 2.6341578483581545,
"sampling/importance_sampling_ratio/mean": 0.98805011510849,
"sampling/importance_sampling_ratio/min": 0.08310610055923462,
"sampling/sampling_logp_difference/max": 1.2378358602523805,
"sampling/sampling_logp_difference/mean": 0.004071460268460214,
"step": 11430,
"step_time": 6.740105595393106
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1419.1,
"completions/max_terminated_length": 1287.7,
"completions/mean_length": 162.181640625,
"completions/mean_terminated_length": 154.91649169921874,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.04477128516882658,
"epoch": 24.49678800856531,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.828125,
"learning_rate": 8.856100000000001e-06,
"loss": -0.0098,
"num_tokens": 1142361761.0,
"reward": 1.0512109577655793,
"reward_std": 0.1846929520368576,
"rewards/reward_accuracy/mean": 0.9515625,
"rewards/reward_accuracy/std": 0.18319982290267944,
"rewards/reward_format/mean": 0.09964843839406967,
"rewards/reward_format/std": 0.0033935268642380834,
"sampling/importance_sampling_ratio/max": 2.451378881931305,
"sampling/importance_sampling_ratio/mean": 0.9899642884731292,
"sampling/importance_sampling_ratio/min": 0.08100753296166659,
"sampling/sampling_logp_difference/max": 1.066279363632202,
"sampling/sampling_logp_difference/mean": 0.004303198028355837,
"step": 11440,
"step_time": 6.884404271296807
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.8102901069360086e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.8102901069360086e-06,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1426.8,
"completions/max_terminated_length": 1307.0,
"completions/mean_length": 178.9515625,
"completions/mean_terminated_length": 165.8474151611328,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.04987931028008461,
"epoch": 24.518201284796575,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.060546875,
"learning_rate": 8.855100000000001e-06,
"loss": -0.0055,
"num_tokens": 1143335589.0,
"reward": 1.0576757907867431,
"reward_std": 0.16300193667411805,
"rewards/reward_accuracy/mean": 0.958203125,
"rewards/reward_accuracy/std": 0.16099151894450187,
"rewards/reward_format/mean": 0.09947265684604645,
"rewards/reward_format/std": 0.004372774832881987,
"sampling/importance_sampling_ratio/max": 2.569707655906677,
"sampling/importance_sampling_ratio/mean": 0.9893218338489532,
"sampling/importance_sampling_ratio/min": 0.03417431898415089,
"sampling/sampling_logp_difference/max": 1.0278971433639525,
"sampling/sampling_logp_difference/mean": 0.004209159524179995,
"step": 11450,
"step_time": 7.045075673612883
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.011328125,
"completions/max_length": 1921.0,
"completions/max_terminated_length": 1655.8,
"completions/mean_length": 181.724609375,
"completions/mean_terminated_length": 160.4189697265625,
"completions/min_length": 69.1,
"completions/min_terminated_length": 69.1,
"entropy": 0.05249150732997805,
"epoch": 24.539614561027836,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.328125,
"learning_rate": 8.8541e-06,
"loss": -0.0051,
"num_tokens": 1144323844.0,
"reward": 1.0468164324760436,
"reward_std": 0.19154097735881806,
"rewards/reward_accuracy/mean": 0.94765625,
"rewards/reward_accuracy/std": 0.1882249854505062,
"rewards/reward_format/mean": 0.09916015788912773,
"rewards/reward_format/std": 0.006704498990438878,
"sampling/importance_sampling_ratio/max": 2.4572949171066285,
"sampling/importance_sampling_ratio/mean": 0.9987372577190399,
"sampling/importance_sampling_ratio/min": 0.07948899269104004,
"sampling/sampling_logp_difference/max": 1.018250012397766,
"sampling/sampling_logp_difference/mean": 0.004507559351623058,
"step": 11460,
"step_time": 9.219569683796726
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1380.4,
"completions/max_terminated_length": 1156.3,
"completions/mean_length": 158.962890625,
"completions/mean_terminated_length": 154.60076751708985,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"entropy": 0.0415050431387499,
"epoch": 24.5610278372591,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.5703125,
"learning_rate": 8.853100000000002e-06,
"loss": -0.0002,
"num_tokens": 1145245701.0,
"reward": 1.0622851729393006,
"reward_std": 0.1658460848033428,
"rewards/reward_accuracy/mean": 0.9625,
"rewards/reward_accuracy/std": 0.16465722247958184,
"rewards/reward_format/mean": 0.09978515729308128,
"rewards/reward_format/std": 0.0023221862968057392,
"sampling/importance_sampling_ratio/max": 2.4512537837028505,
"sampling/importance_sampling_ratio/mean": 0.9899469077587127,
"sampling/importance_sampling_ratio/min": 0.1291986234486103,
"sampling/sampling_logp_difference/max": 1.113043224811554,
"sampling/sampling_logp_difference/mean": 0.003818103391677141,
"step": 11470,
"step_time": 6.523674901595223
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1171.3,
"completions/max_terminated_length": 935.5,
"completions/mean_length": 144.759765625,
"completions/mean_terminated_length": 143.26134719848633,
"completions/min_length": 67.2,
"completions/min_terminated_length": 67.2,
"entropy": 0.03921297781635076,
"epoch": 24.582441113490365,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.1015625,
"learning_rate": 8.852100000000001e-06,
"loss": -0.0053,
"num_tokens": 1146135422.0,
"reward": 1.0826953291893004,
"reward_std": 0.09115807637572289,
"rewards/reward_accuracy/mean": 0.9828125,
"rewards/reward_accuracy/std": 0.09044206589460373,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.0016351743368431925,
"sampling/importance_sampling_ratio/max": 2.410450041294098,
"sampling/importance_sampling_ratio/mean": 0.9926283776760101,
"sampling/importance_sampling_ratio/min": 0.12632172852754592,
"sampling/sampling_logp_difference/max": 1.0280497670173645,
"sampling/sampling_logp_difference/mean": 0.0041117801098153,
"step": 11480,
"step_time": 5.635658663883805
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1300.7,
"completions/max_terminated_length": 1127.3,
"completions/mean_length": 159.901953125,
"completions/mean_terminated_length": 145.8620864868164,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.045784329646267,
"epoch": 24.603854389721626,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.8511e-06,
"loss": -0.0039,
"num_tokens": 1147059667.0,
"reward": 1.0694336235523223,
"reward_std": 0.13790928795933724,
"rewards/reward_accuracy/mean": 0.969921875,
"rewards/reward_accuracy/std": 0.13545964062213897,
"rewards/reward_format/mean": 0.09951172098517418,
"rewards/reward_format/std": 0.004494223464280367,
"sampling/importance_sampling_ratio/max": 2.420927357673645,
"sampling/importance_sampling_ratio/mean": 0.9892075538635254,
"sampling/importance_sampling_ratio/min": 0.11134791821241379,
"sampling/sampling_logp_difference/max": 0.8713419377803803,
"sampling/sampling_logp_difference/mean": 0.004220950696617365,
"step": 11490,
"step_time": 6.445384803894558
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1295.6,
"completions/max_terminated_length": 942.8,
"completions/mean_length": 143.333203125,
"completions/mean_terminated_length": 140.35352630615233,
"completions/min_length": 66.3,
"completions/min_terminated_length": 66.3,
"entropy": 0.03696079475339502,
"epoch": 24.62526766595289,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.8501e-06,
"loss": 0.0005,
"num_tokens": 1147944808.0,
"reward": 1.0826757907867433,
"reward_std": 0.09347372800111771,
"rewards/reward_accuracy/mean": 0.9828125,
"rewards/reward_accuracy/std": 0.09246495440602302,
"rewards/reward_format/mean": 0.09986328184604645,
"rewards/reward_format/std": 0.0019476743880659341,
"sampling/importance_sampling_ratio/max": 2.5079275131225587,
"sampling/importance_sampling_ratio/mean": 0.9874938786029815,
"sampling/importance_sampling_ratio/min": 0.19421122670173646,
"sampling/sampling_logp_difference/max": 1.0366042017936707,
"sampling/sampling_logp_difference/mean": 0.0038452080218121408,
"step": 11500,
"step_time": 6.092486617201939
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 932.1,
"completions/max_terminated_length": 839.8,
"completions/mean_length": 139.587109375,
"completions/mean_terminated_length": 133.71231842041016,
"completions/min_length": 57.5,
"completions/min_terminated_length": 57.5,
"entropy": 0.03758861490059644,
"epoch": 24.646680942184155,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.2197265625,
"learning_rate": 8.8491e-06,
"loss": -0.0042,
"num_tokens": 1148811527.0,
"reward": 1.0650586128234862,
"reward_std": 0.14299491941928863,
"rewards/reward_accuracy/mean": 0.965234375,
"rewards/reward_accuracy/std": 0.14210830852389336,
"rewards/reward_format/mean": 0.0998242199420929,
"rewards/reward_format/std": 0.002184226457029581,
"sampling/importance_sampling_ratio/max": 2.249864709377289,
"sampling/importance_sampling_ratio/mean": 0.9926517009735107,
"sampling/importance_sampling_ratio/min": 0.18908779621124266,
"sampling/sampling_logp_difference/max": 0.9120428085327148,
"sampling/sampling_logp_difference/mean": 0.003727308753877878,
"step": 11510,
"step_time": 4.822533711008146
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1193.6,
"completions/max_terminated_length": 1118.8,
"completions/mean_length": 160.71796875,
"completions/mean_terminated_length": 154.82896423339844,
"completions/min_length": 67.3,
"completions/min_terminated_length": 67.3,
"entropy": 0.040314287901856004,
"epoch": 24.66809421841542,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.0,
"learning_rate": 8.848100000000001e-06,
"loss": -0.0074,
"num_tokens": 1149741669.0,
"reward": 1.0716406583786011,
"reward_std": 0.1297914169728756,
"rewards/reward_accuracy/mean": 0.971875,
"rewards/reward_accuracy/std": 0.12895720675587655,
"rewards/reward_format/mean": 0.09976562708616257,
"rewards/reward_format/std": 0.0026552829192951323,
"sampling/importance_sampling_ratio/max": 2.379506552219391,
"sampling/importance_sampling_ratio/mean": 0.9757439613342285,
"sampling/importance_sampling_ratio/min": 0.13265141956508159,
"sampling/sampling_logp_difference/max": 0.9841375231742859,
"sampling/sampling_logp_difference/mean": 0.0040490796323865656,
"step": 11520,
"step_time": 5.946366826404119
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1627.0,
"completions/max_terminated_length": 1488.1,
"completions/mean_length": 151.3234375,
"completions/mean_terminated_length": 146.87671508789063,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.04188539159949869,
"epoch": 24.68950749464668,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.2431640625,
"learning_rate": 8.8471e-06,
"loss": -0.0111,
"num_tokens": 1150640817.0,
"reward": 1.084179699420929,
"reward_std": 0.11729680821299553,
"rewards/reward_accuracy/mean": 0.984375,
"rewards/reward_accuracy/std": 0.11596417054533958,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.0027571487706154587,
"sampling/importance_sampling_ratio/max": 2.309400427341461,
"sampling/importance_sampling_ratio/mean": 0.9883949041366578,
"sampling/importance_sampling_ratio/min": 0.06424383074045181,
"sampling/sampling_logp_difference/max": 0.9250307083129883,
"sampling/sampling_logp_difference/mean": 0.0040994359413161876,
"step": 11530,
"step_time": 7.561608352002804
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1299.7,
"completions/max_terminated_length": 1073.3,
"completions/mean_length": 160.19921875,
"completions/mean_terminated_length": 154.34137878417968,
"completions/min_length": 62.6,
"completions/min_terminated_length": 62.6,
"entropy": 0.04335546467918903,
"epoch": 24.710920770877944,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.224609375,
"learning_rate": 8.846100000000002e-06,
"loss": -0.0054,
"num_tokens": 1151572063.0,
"reward": 1.0502148747444153,
"reward_std": 0.17701527699828148,
"rewards/reward_accuracy/mean": 0.950390625,
"rewards/reward_accuracy/std": 0.17631329447031022,
"rewards/reward_format/mean": 0.09982422068715095,
"rewards/reward_format/std": 0.0022048230282962324,
"sampling/importance_sampling_ratio/max": 2.5933863639831545,
"sampling/importance_sampling_ratio/mean": 0.994813758134842,
"sampling/importance_sampling_ratio/min": 0.11766025573015212,
"sampling/sampling_logp_difference/max": 0.9863908171653748,
"sampling/sampling_logp_difference/mean": 0.004102376475930214,
"step": 11540,
"step_time": 6.317032860807376
},
{
"clip_ratio/high_max": 2.3992321803234518e-05,
"clip_ratio/high_mean": 2.9990402254043148e-06,
"clip_ratio/low_mean": 8.839056590659311e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.882945884470246e-06,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1589.5,
"completions/max_terminated_length": 1306.7,
"completions/mean_length": 173.275390625,
"completions/mean_terminated_length": 159.44882507324218,
"completions/min_length": 69.6,
"completions/min_terminated_length": 69.6,
"entropy": 0.05174017285462469,
"epoch": 24.73233404710921,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.103515625,
"learning_rate": 8.845100000000001e-06,
"loss": -0.0077,
"num_tokens": 1152534304.0,
"reward": 1.038828146457672,
"reward_std": 0.21548354253172874,
"rewards/reward_accuracy/mean": 0.939453125,
"rewards/reward_accuracy/std": 0.21308973878622056,
"rewards/reward_format/mean": 0.09937500059604645,
"rewards/reward_format/std": 0.005266284290701151,
"sampling/importance_sampling_ratio/max": 2.7031415700912476,
"sampling/importance_sampling_ratio/mean": 0.9799237966537475,
"sampling/importance_sampling_ratio/min": 0.10528819411993026,
"sampling/sampling_logp_difference/max": 1.012935221195221,
"sampling/sampling_logp_difference/mean": 0.004526874609291553,
"step": 11550,
"step_time": 7.829685478491593
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1362.6,
"completions/max_terminated_length": 1097.0,
"completions/mean_length": 165.143359375,
"completions/mean_terminated_length": 154.068994140625,
"completions/min_length": 66.5,
"completions/min_terminated_length": 66.5,
"entropy": 0.03925480709876865,
"epoch": 24.75374732334047,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.1572265625,
"learning_rate": 8.8441e-06,
"loss": -0.0,
"num_tokens": 1153472751.0,
"reward": 1.0578320622444153,
"reward_std": 0.15901368260383605,
"rewards/reward_accuracy/mean": 0.958203125,
"rewards/reward_accuracy/std": 0.1571851849555969,
"rewards/reward_format/mean": 0.09962890818715095,
"rewards/reward_format/std": 0.003825234086252749,
"sampling/importance_sampling_ratio/max": 2.658196806907654,
"sampling/importance_sampling_ratio/mean": 0.9937107264995575,
"sampling/importance_sampling_ratio/min": 0.09877435863018036,
"sampling/sampling_logp_difference/max": 1.0746466517448425,
"sampling/sampling_logp_difference/mean": 0.003791561885736883,
"step": 11560,
"step_time": 6.749646380788181
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1264.6,
"completions/max_terminated_length": 1185.8,
"completions/mean_length": 143.499609375,
"completions/mean_terminated_length": 141.30639190673827,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.03889824373181909,
"epoch": 24.775160599571734,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.83203125,
"learning_rate": 8.843100000000002e-06,
"loss": -0.004,
"num_tokens": 1154358158.0,
"reward": 1.0803125023841857,
"reward_std": 0.09712216258049011,
"rewards/reward_accuracy/mean": 0.98046875,
"rewards/reward_accuracy/std": 0.09616324603557587,
"rewards/reward_format/mean": 0.09984375014901162,
"rewards/reward_format/std": 0.0021321487613022326,
"sampling/importance_sampling_ratio/max": 2.366607892513275,
"sampling/importance_sampling_ratio/mean": 0.9921908736228943,
"sampling/importance_sampling_ratio/min": 0.1572517231106758,
"sampling/sampling_logp_difference/max": 0.8286054968833924,
"sampling/sampling_logp_difference/mean": 0.0038996870163828133,
"step": 11570,
"step_time": 5.949800437796512
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008203125,
"completions/max_length": 1597.3,
"completions/max_terminated_length": 1068.4,
"completions/mean_length": 180.34921875,
"completions/mean_terminated_length": 165.31766357421876,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.05124708346556872,
"epoch": 24.796573875803,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.06494140625,
"learning_rate": 8.842100000000001e-06,
"loss": -0.0092,
"num_tokens": 1155340700.0,
"reward": 1.0716211199760437,
"reward_std": 0.12380107194185257,
"rewards/reward_accuracy/mean": 0.972265625,
"rewards/reward_accuracy/std": 0.12037106081843377,
"rewards/reward_format/mean": 0.09935547038912773,
"rewards/reward_format/std": 0.005775287887081504,
"sampling/importance_sampling_ratio/max": 2.352944755554199,
"sampling/importance_sampling_ratio/mean": 0.9774632334709168,
"sampling/importance_sampling_ratio/min": 0.14741878751665355,
"sampling/sampling_logp_difference/max": 1.0195234775543214,
"sampling/sampling_logp_difference/mean": 0.004190104315057397,
"step": 11580,
"step_time": 7.896657764105475
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 743.1,
"completions/max_terminated_length": 578.6,
"completions/mean_length": 137.631640625,
"completions/mean_terminated_length": 135.37060775756837,
"completions/min_length": 69.1,
"completions/min_terminated_length": 69.1,
"entropy": 0.03538150938693434,
"epoch": 24.817987152034263,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.0,
"learning_rate": 8.8411e-06,
"loss": 0.003,
"num_tokens": 1156208973.0,
"reward": 1.0869922161102294,
"reward_std": 0.07904013991355896,
"rewards/reward_accuracy/mean": 0.987109375,
"rewards/reward_accuracy/std": 0.07820367589592933,
"rewards/reward_format/mean": 0.09988281428813935,
"rewards/reward_format/std": 0.001323223067447543,
"sampling/importance_sampling_ratio/max": 2.398220980167389,
"sampling/importance_sampling_ratio/mean": 0.9995456457138061,
"sampling/importance_sampling_ratio/min": 0.2407411053776741,
"sampling/sampling_logp_difference/max": 0.8976225256919861,
"sampling/sampling_logp_difference/mean": 0.0037757280515506864,
"step": 11590,
"step_time": 3.9459968934970675
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1097.1,
"completions/max_terminated_length": 992.9,
"completions/mean_length": 156.420703125,
"completions/mean_terminated_length": 154.22191925048827,
"completions/min_length": 61.5,
"completions/min_terminated_length": 61.5,
"entropy": 0.03933241048362106,
"epoch": 24.839400428265524,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.8401e-06,
"loss": -0.0062,
"num_tokens": 1157138322.0,
"reward": 1.0732617497444152,
"reward_std": 0.10534188523888588,
"rewards/reward_accuracy/mean": 0.9734375,
"rewards/reward_accuracy/std": 0.10480054095387459,
"rewards/reward_format/mean": 0.09982422068715095,
"rewards/reward_format/std": 0.0014439307153224946,
"sampling/importance_sampling_ratio/max": 2.4240442633628847,
"sampling/importance_sampling_ratio/mean": 0.9846010446548462,
"sampling/importance_sampling_ratio/min": 0.13089885264635087,
"sampling/sampling_logp_difference/max": 1.0958173036575318,
"sampling/sampling_logp_difference/mean": 0.003776249778456986,
"step": 11600,
"step_time": 5.480934574300773
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1440.3,
"completions/max_terminated_length": 1350.0,
"completions/mean_length": 168.93046875,
"completions/mean_terminated_length": 155.14053192138672,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.04702919747214764,
"epoch": 24.86081370449679,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.578125,
"learning_rate": 8.8391e-06,
"loss": -0.002,
"num_tokens": 1158093120.0,
"reward": 1.072812521457672,
"reward_std": 0.13204583302140235,
"rewards/reward_accuracy/mean": 0.9734375,
"rewards/reward_accuracy/std": 0.130546697974205,
"rewards/reward_format/mean": 0.09937500059604645,
"rewards/reward_format/std": 0.0037783582927659156,
"sampling/importance_sampling_ratio/max": 2.497168278694153,
"sampling/importance_sampling_ratio/mean": 0.9866295754909515,
"sampling/importance_sampling_ratio/min": 0.15930032283067702,
"sampling/sampling_logp_difference/max": 0.8909991323947907,
"sampling/sampling_logp_difference/mean": 0.004193868418224156,
"step": 11610,
"step_time": 7.115064460792928
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1230.8,
"completions/max_terminated_length": 1024.9,
"completions/mean_length": 165.118359375,
"completions/mean_terminated_length": 154.11683197021483,
"completions/min_length": 69.1,
"completions/min_terminated_length": 69.1,
"entropy": 0.041004395857453343,
"epoch": 24.882226980728053,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.838100000000001e-06,
"loss": -0.0026,
"num_tokens": 1159036111.0,
"reward": 1.064746117591858,
"reward_std": 0.14719562083482743,
"rewards/reward_accuracy/mean": 0.965234375,
"rewards/reward_accuracy/std": 0.14493229985237122,
"rewards/reward_format/mean": 0.09951172024011612,
"rewards/reward_format/std": 0.003816214483231306,
"sampling/importance_sampling_ratio/max": 2.3247634530067445,
"sampling/importance_sampling_ratio/mean": 0.9809003949165345,
"sampling/importance_sampling_ratio/min": 0.14737108945846558,
"sampling/sampling_logp_difference/max": 1.048286497592926,
"sampling/sampling_logp_difference/mean": 0.003942421823740006,
"step": 11620,
"step_time": 6.449934729078086
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1393.7,
"completions/max_terminated_length": 1263.8,
"completions/mean_length": 167.6546875,
"completions/mean_terminated_length": 154.51653137207032,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.04341005722526461,
"epoch": 24.903640256959314,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.201171875,
"learning_rate": 8.8371e-06,
"loss": -0.0021,
"num_tokens": 1159986539.0,
"reward": 1.050195336341858,
"reward_std": 0.18638237118721007,
"rewards/reward_accuracy/mean": 0.95078125,
"rewards/reward_accuracy/std": 0.18467846810817717,
"rewards/reward_format/mean": 0.09941406399011612,
"rewards/reward_format/std": 0.004106687498278916,
"sampling/importance_sampling_ratio/max": 2.5846595048904417,
"sampling/importance_sampling_ratio/mean": 0.9851103246212005,
"sampling/importance_sampling_ratio/min": 0.11403252370655537,
"sampling/sampling_logp_difference/max": 1.07488956451416,
"sampling/sampling_logp_difference/mean": 0.0038216853979974987,
"step": 11630,
"step_time": 6.78461997990089
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 656.0,
"completions/max_terminated_length": 579.7,
"completions/mean_length": 133.59765625,
"completions/mean_terminated_length": 132.11268157958983,
"completions/min_length": 59.7,
"completions/min_terminated_length": 59.7,
"entropy": 0.03204650692641735,
"epoch": 24.925053533190578,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.06640625,
"learning_rate": 8.8361e-06,
"loss": -0.0009,
"num_tokens": 1160845109.0,
"reward": 1.079648458957672,
"reward_std": 0.09690443426370621,
"rewards/reward_accuracy/mean": 0.9796875,
"rewards/reward_accuracy/std": 0.09674532264471054,
"rewards/reward_format/mean": 0.0999609388411045,
"rewards/reward_format/std": 0.0006250000558793544,
"sampling/importance_sampling_ratio/max": 2.5285298109054564,
"sampling/importance_sampling_ratio/mean": 0.9996402621269226,
"sampling/importance_sampling_ratio/min": 0.19453845918178558,
"sampling/sampling_logp_difference/max": 1.2302896201610565,
"sampling/sampling_logp_difference/mean": 0.0036977163748815657,
"step": 11640,
"step_time": 3.4975309082947206
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1299.0,
"completions/max_terminated_length": 938.1,
"completions/mean_length": 163.11015625,
"completions/mean_terminated_length": 153.65223236083983,
"completions/min_length": 70.1,
"completions/min_terminated_length": 70.1,
"entropy": 0.0430661903694272,
"epoch": 24.946466809421842,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 8.835100000000001e-06,
"loss": 0.0034,
"num_tokens": 1161773039.0,
"reward": 1.0783398628234864,
"reward_std": 0.10861445888876915,
"rewards/reward_accuracy/mean": 0.97890625,
"rewards/reward_accuracy/std": 0.10595177933573723,
"rewards/reward_format/mean": 0.09943359419703483,
"rewards/reward_format/std": 0.004390925215557217,
"sampling/importance_sampling_ratio/max": 2.3853073835372927,
"sampling/importance_sampling_ratio/mean": 0.990993994474411,
"sampling/importance_sampling_ratio/min": 0.13993528187274934,
"sampling/sampling_logp_difference/max": 0.9645407199859619,
"sampling/sampling_logp_difference/mean": 0.0039678989443928,
"step": 11650,
"step_time": 6.5280851492017975
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1346.4,
"completions/max_terminated_length": 1258.1,
"completions/mean_length": 151.483203125,
"completions/mean_terminated_length": 147.8320114135742,
"completions/min_length": 60.4,
"completions/min_terminated_length": 60.4,
"entropy": 0.04319322386290878,
"epoch": 24.967880085653103,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 8.8341e-06,
"loss": 0.0014,
"num_tokens": 1162675428.0,
"reward": 1.0689062654972077,
"reward_std": 0.11991382017731667,
"rewards/reward_accuracy/mean": 0.969140625,
"rewards/reward_accuracy/std": 0.11927450820803642,
"rewards/reward_format/mean": 0.09976562485098839,
"rewards/reward_format/std": 0.002953278413042426,
"sampling/importance_sampling_ratio/max": 2.3345097064971925,
"sampling/importance_sampling_ratio/mean": 0.988205224275589,
"sampling/importance_sampling_ratio/min": 0.10267329998314381,
"sampling/sampling_logp_difference/max": 0.9835515737533569,
"sampling/sampling_logp_difference/mean": 0.0042690388858318325,
"step": 11660,
"step_time": 6.265104782595881
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.9706595543975706e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.9706595543975706e-06,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1331.0,
"completions/max_terminated_length": 1060.5,
"completions/mean_length": 166.38984375,
"completions/mean_terminated_length": 147.92832794189454,
"completions/min_length": 62.7,
"completions/min_terminated_length": 62.7,
"entropy": 0.04110856696497649,
"epoch": 24.989293361884368,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.490234375,
"learning_rate": 8.833100000000002e-06,
"loss": -0.0027,
"num_tokens": 1163618218.0,
"reward": 1.0525586009025574,
"reward_std": 0.16967344358563424,
"rewards/reward_accuracy/mean": 0.953515625,
"rewards/reward_accuracy/std": 0.1661395438015461,
"rewards/reward_format/mean": 0.09904296919703484,
"rewards/reward_format/std": 0.005833205860108137,
"sampling/importance_sampling_ratio/max": 2.5621554613113404,
"sampling/importance_sampling_ratio/mean": 0.9896980345249176,
"sampling/importance_sampling_ratio/min": 0.08940293490886689,
"sampling/sampling_logp_difference/max": 1.0729960203170776,
"sampling/sampling_logp_difference/mean": 0.0037609555525705217,
"step": 11670,
"step_time": 6.889724023305462
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1446.8,
"completions/max_terminated_length": 1151.9,
"completions/mean_length": 155.0359375,
"completions/mean_terminated_length": 143.91909790039062,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.040591302700340746,
"epoch": 25.010706638115632,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.10595703125,
"learning_rate": 8.832100000000001e-06,
"loss": -0.0116,
"num_tokens": 1164531974.0,
"reward": 1.0801757991313934,
"reward_std": 0.09989474595058709,
"rewards/reward_accuracy/mean": 0.98046875,
"rewards/reward_accuracy/std": 0.09806107506155967,
"rewards/reward_format/mean": 0.09970703274011612,
"rewards/reward_format/std": 0.0030193310929462315,
"sampling/importance_sampling_ratio/max": 2.5384386777877808,
"sampling/importance_sampling_ratio/mean": 0.9890837848186493,
"sampling/importance_sampling_ratio/min": 0.034183576330542566,
"sampling/sampling_logp_difference/max": 1.0634939789772033,
"sampling/sampling_logp_difference/mean": 0.0041737109888345,
"step": 11680,
"step_time": 6.815765389511943
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1077.3,
"completions/max_terminated_length": 918.0,
"completions/mean_length": 147.726953125,
"completions/mean_terminated_length": 141.8236099243164,
"completions/min_length": 67.3,
"completions/min_terminated_length": 67.3,
"entropy": 0.036078854999504986,
"epoch": 25.032119914346897,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.29296875,
"learning_rate": 8.831100000000001e-06,
"loss": -0.0038,
"num_tokens": 1165428299.0,
"reward": 1.0677148699760437,
"reward_std": 0.13663432002067566,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.13574677482247352,
"rewards/reward_format/mean": 0.09974609538912774,
"rewards/reward_format/std": 0.0023959687910974025,
"sampling/importance_sampling_ratio/max": 2.420542597770691,
"sampling/importance_sampling_ratio/mean": 0.9959983408451081,
"sampling/importance_sampling_ratio/min": 0.16519849747419357,
"sampling/sampling_logp_difference/max": 0.9878079175949097,
"sampling/sampling_logp_difference/mean": 0.003753657778725028,
"step": 11690,
"step_time": 5.363844746598625
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 979.3,
"completions/max_terminated_length": 577.6,
"completions/mean_length": 143.98359375,
"completions/mean_terminated_length": 141.0315704345703,
"completions/min_length": 59.9,
"completions/min_terminated_length": 59.9,
"entropy": 0.035307901841588316,
"epoch": 25.053533190578158,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.208984375,
"learning_rate": 8.8301e-06,
"loss": 0.0009,
"num_tokens": 1166317409.0,
"reward": 1.0784765839576722,
"reward_std": 0.09941446185111999,
"rewards/reward_accuracy/mean": 0.978515625,
"rewards/reward_accuracy/std": 0.09912607222795486,
"rewards/reward_format/mean": 0.0999609388411045,
"rewards/reward_format/std": 0.0006250000558793544,
"sampling/importance_sampling_ratio/max": 2.447040283679962,
"sampling/importance_sampling_ratio/mean": 0.9919553101062775,
"sampling/importance_sampling_ratio/min": 0.13482314571738244,
"sampling/sampling_logp_difference/max": 0.9930066108703614,
"sampling/sampling_logp_difference/mean": 0.003762523317709565,
"step": 11700,
"step_time": 4.816365924794809
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.5022890895343155e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.5022890895343155e-06,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1339.1,
"completions/max_terminated_length": 1188.0,
"completions/mean_length": 168.430859375,
"completions/mean_terminated_length": 151.62194213867187,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.04620353525970131,
"epoch": 25.074946466809422,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.330078125,
"learning_rate": 8.8291e-06,
"loss": -0.008,
"num_tokens": 1167268480.0,
"reward": 1.062265646457672,
"reward_std": 0.15694005712866782,
"rewards/reward_accuracy/mean": 0.962890625,
"rewards/reward_accuracy/std": 0.15426238030195236,
"rewards/reward_format/mean": 0.09937500134110451,
"rewards/reward_format/std": 0.005006308760493993,
"sampling/importance_sampling_ratio/max": 2.520407557487488,
"sampling/importance_sampling_ratio/mean": 0.9860046327114105,
"sampling/importance_sampling_ratio/min": 0.06468951627612114,
"sampling/sampling_logp_difference/max": 0.9298304319381714,
"sampling/sampling_logp_difference/mean": 0.004236089950427413,
"step": 11710,
"step_time": 6.614795396014233
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1518.8,
"completions/max_terminated_length": 1179.7,
"completions/mean_length": 156.046875,
"completions/mean_terminated_length": 147.20402297973632,
"completions/min_length": 62.1,
"completions/min_terminated_length": 62.1,
"entropy": 0.04650615768041462,
"epoch": 25.096359743040686,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 8.828100000000001e-06,
"loss": -0.0079,
"num_tokens": 1168184568.0,
"reward": 1.0715625405311584,
"reward_std": 0.12740758955478668,
"rewards/reward_accuracy/mean": 0.971875,
"rewards/reward_accuracy/std": 0.1256304793059826,
"rewards/reward_format/mean": 0.0996875025331974,
"rewards/reward_format/std": 0.0034980851924046874,
"sampling/importance_sampling_ratio/max": 2.326052558422089,
"sampling/importance_sampling_ratio/mean": 0.983920568227768,
"sampling/importance_sampling_ratio/min": 0.06883149892091751,
"sampling/sampling_logp_difference/max": 0.9687305986881256,
"sampling/sampling_logp_difference/mean": 0.004082873254083097,
"step": 11720,
"step_time": 7.411906878411537
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1068.5,
"completions/max_terminated_length": 1024.3,
"completions/mean_length": 157.50390625,
"completions/mean_terminated_length": 155.2931884765625,
"completions/min_length": 69.9,
"completions/min_terminated_length": 69.9,
"entropy": 0.04176198339555413,
"epoch": 25.117773019271947,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.25,
"learning_rate": 8.8271e-06,
"loss": -0.0051,
"num_tokens": 1169112754.0,
"reward": 1.0627148628234864,
"reward_std": 0.1308155559003353,
"rewards/reward_accuracy/mean": 0.962890625,
"rewards/reward_accuracy/std": 0.13050552681088448,
"rewards/reward_format/mean": 0.0998242199420929,
"rewards/reward_format/std": 0.001544908178038895,
"sampling/importance_sampling_ratio/max": 2.3634698390960693,
"sampling/importance_sampling_ratio/mean": 0.986687821149826,
"sampling/importance_sampling_ratio/min": 0.1103975385427475,
"sampling/sampling_logp_difference/max": 0.9080157041549682,
"sampling/sampling_logp_difference/mean": 0.003961260593496263,
"step": 11730,
"step_time": 5.399184458187665
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1620.8,
"completions/max_terminated_length": 1364.5,
"completions/mean_length": 161.604296875,
"completions/mean_terminated_length": 146.84166870117187,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.04128730827942491,
"epoch": 25.13918629550321,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.279296875,
"learning_rate": 8.8261e-06,
"loss": -0.0065,
"num_tokens": 1170039549.0,
"reward": 1.0685547232627868,
"reward_std": 0.13831521496176719,
"rewards/reward_accuracy/mean": 0.969140625,
"rewards/reward_accuracy/std": 0.13573938310146333,
"rewards/reward_format/mean": 0.09941406473517418,
"rewards/reward_format/std": 0.005008798930794001,
"sampling/importance_sampling_ratio/max": 2.434616434574127,
"sampling/importance_sampling_ratio/mean": 0.9761597692966462,
"sampling/importance_sampling_ratio/min": 0.15574621325358748,
"sampling/sampling_logp_difference/max": 1.0427399396896362,
"sampling/sampling_logp_difference/mean": 0.004120216704905033,
"step": 11740,
"step_time": 7.836080552591011
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1379.0,
"completions/max_terminated_length": 964.4,
"completions/mean_length": 147.533984375,
"completions/mean_terminated_length": 142.36864013671874,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.0367814481491223,
"epoch": 25.160599571734476,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0,
"learning_rate": 8.825100000000001e-06,
"loss": -0.0047,
"num_tokens": 1170939844.0,
"reward": 1.0755664229393005,
"reward_std": 0.11806240677833557,
"rewards/reward_accuracy/mean": 0.97578125,
"rewards/reward_accuracy/std": 0.11677940785884858,
"rewards/reward_format/mean": 0.09978515803813934,
"rewards/reward_format/std": 0.002147300215438008,
"sampling/importance_sampling_ratio/max": 2.5570509672164916,
"sampling/importance_sampling_ratio/mean": 0.997406804561615,
"sampling/importance_sampling_ratio/min": 0.1294231027364731,
"sampling/sampling_logp_difference/max": 0.9700933575630188,
"sampling/sampling_logp_difference/mean": 0.0038160794880241155,
"step": 11750,
"step_time": 6.542373317896272
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1328.8,
"completions/max_terminated_length": 1138.9,
"completions/mean_length": 171.7421875,
"completions/mean_terminated_length": 159.5953628540039,
"completions/min_length": 70.1,
"completions/min_terminated_length": 70.1,
"entropy": 0.04441801675129682,
"epoch": 25.182012847965737,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.056396484375,
"learning_rate": 8.8241e-06,
"loss": -0.0107,
"num_tokens": 1171900672.0,
"reward": 1.058203136920929,
"reward_std": 0.16885271444916725,
"rewards/reward_accuracy/mean": 0.95859375,
"rewards/reward_accuracy/std": 0.16754491105675698,
"rewards/reward_format/mean": 0.09960937574505806,
"rewards/reward_format/std": 0.0026487976545467974,
"sampling/importance_sampling_ratio/max": 2.44380499124527,
"sampling/importance_sampling_ratio/mean": 0.9867900133132934,
"sampling/importance_sampling_ratio/min": 0.14569816794246435,
"sampling/sampling_logp_difference/max": 0.8336219549179077,
"sampling/sampling_logp_difference/mean": 0.004068160010501742,
"step": 11760,
"step_time": 6.452340313783497
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1083.3,
"completions/max_terminated_length": 743.2,
"completions/mean_length": 151.8203125,
"completions/mean_terminated_length": 147.41795196533204,
"completions/min_length": 65.6,
"completions/min_terminated_length": 65.6,
"entropy": 0.03558928295969963,
"epoch": 25.203426124197,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.330078125,
"learning_rate": 8.8231e-06,
"loss": 0.0003,
"num_tokens": 1172809428.0,
"reward": 1.0759375274181366,
"reward_std": 0.11766184195876121,
"rewards/reward_accuracy/mean": 0.976171875,
"rewards/reward_accuracy/std": 0.11607105433940887,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0024903098121285437,
"sampling/importance_sampling_ratio/max": 2.5566115856170653,
"sampling/importance_sampling_ratio/mean": 0.9887578547000885,
"sampling/importance_sampling_ratio/min": 0.14180979132652283,
"sampling/sampling_logp_difference/max": 0.919329297542572,
"sampling/sampling_logp_difference/mean": 0.0036144728306680917,
"step": 11770,
"step_time": 5.3436689309193754
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1286.6,
"completions/max_terminated_length": 984.7,
"completions/mean_length": 154.629296875,
"completions/mean_terminated_length": 148.74538803100586,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.03473868323490024,
"epoch": 25.224839400428266,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.822100000000001e-06,
"loss": -0.0044,
"num_tokens": 1173724223.0,
"reward": 1.0649609565734863,
"reward_std": 0.1467112921178341,
"rewards/reward_accuracy/mean": 0.965234375,
"rewards/reward_accuracy/std": 0.1451020561158657,
"rewards/reward_format/mean": 0.0997265636920929,
"rewards/reward_format/std": 0.00287779972422868,
"sampling/importance_sampling_ratio/max": 2.426754415035248,
"sampling/importance_sampling_ratio/mean": 0.9870110750198364,
"sampling/importance_sampling_ratio/min": 0.14204904288053513,
"sampling/sampling_logp_difference/max": 1.0216006457805633,
"sampling/sampling_logp_difference/mean": 0.0035395718878135085,
"step": 11780,
"step_time": 6.3110700825112875
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1183.3,
"completions/max_terminated_length": 1169.7,
"completions/mean_length": 157.576171875,
"completions/mean_terminated_length": 151.05646209716798,
"completions/min_length": 62.4,
"completions/min_terminated_length": 62.4,
"entropy": 0.03882357107941061,
"epoch": 25.24625267665953,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.390625,
"learning_rate": 8.821100000000001e-06,
"loss": -0.0047,
"num_tokens": 1174647666.0,
"reward": 1.070410180091858,
"reward_std": 0.11960920616984368,
"rewards/reward_accuracy/mean": 0.970703125,
"rewards/reward_accuracy/std": 0.11836637333035469,
"rewards/reward_format/mean": 0.09970703274011612,
"rewards/reward_format/std": 0.00279677405487746,
"sampling/importance_sampling_ratio/max": 2.5353647232055665,
"sampling/importance_sampling_ratio/mean": 0.9867514133453369,
"sampling/importance_sampling_ratio/min": 0.1615223990753293,
"sampling/sampling_logp_difference/max": 0.9273634076118469,
"sampling/sampling_logp_difference/mean": 0.003860479546710849,
"step": 11790,
"step_time": 5.755739016502048
},
{
"clip_ratio/high_max": 1.66917045135051e-05,
"clip_ratio/high_mean": 2.0864630641881376e-06,
"clip_ratio/low_mean": 3.8618386497546455e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.472646929163602e-06,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1481.0,
"completions/max_terminated_length": 1169.7,
"completions/mean_length": 177.7171875,
"completions/mean_terminated_length": 159.68216934204102,
"completions/min_length": 67.5,
"completions/min_terminated_length": 67.5,
"entropy": 0.05036316788755357,
"epoch": 25.26766595289079,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.134765625,
"learning_rate": 8.8201e-06,
"loss": -0.0058,
"num_tokens": 1175632894.0,
"reward": 1.0573046922683715,
"reward_std": 0.13658633306622506,
"rewards/reward_accuracy/mean": 0.9578125,
"rewards/reward_accuracy/std": 0.13458233550190926,
"rewards/reward_format/mean": 0.09949218705296517,
"rewards/reward_format/std": 0.004087644279934466,
"sampling/importance_sampling_ratio/max": 2.5561742782592773,
"sampling/importance_sampling_ratio/mean": 0.9906927466392517,
"sampling/importance_sampling_ratio/min": 0.073750451952219,
"sampling/sampling_logp_difference/max": 1.1589884757995605,
"sampling/sampling_logp_difference/mean": 0.004245465574786067,
"step": 11800,
"step_time": 7.391666824495769
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1344.3,
"completions/max_terminated_length": 1256.4,
"completions/mean_length": 185.33125,
"completions/mean_terminated_length": 178.0671188354492,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.049547436111606655,
"epoch": 25.289079229122056,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.2578125,
"learning_rate": 8.8191e-06,
"loss": -0.0086,
"num_tokens": 1176630414.0,
"reward": 1.0613476872444152,
"reward_std": 0.14130059331655503,
"rewards/reward_accuracy/mean": 0.96171875,
"rewards/reward_accuracy/std": 0.13952610343694688,
"rewards/reward_format/mean": 0.09962890893220902,
"rewards/reward_format/std": 0.003720488352701068,
"sampling/importance_sampling_ratio/max": 2.4948147773742675,
"sampling/importance_sampling_ratio/mean": 0.9821997702121734,
"sampling/importance_sampling_ratio/min": 0.08458269909024238,
"sampling/sampling_logp_difference/max": 0.9189260065555572,
"sampling/sampling_logp_difference/mean": 0.004214448062703014,
"step": 11810,
"step_time": 6.836644690320827
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1523.9,
"completions/max_terminated_length": 1352.9,
"completions/mean_length": 161.015625,
"completions/mean_terminated_length": 150.64349212646485,
"completions/min_length": 65.7,
"completions/min_terminated_length": 65.7,
"entropy": 0.045230041607283056,
"epoch": 25.31049250535332,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.0,
"learning_rate": 8.818100000000001e-06,
"loss": -0.0042,
"num_tokens": 1177556598.0,
"reward": 1.0714062690734862,
"reward_std": 0.13925908207893373,
"rewards/reward_accuracy/mean": 0.971875,
"rewards/reward_accuracy/std": 0.13716317638754844,
"rewards/reward_format/mean": 0.0995312511920929,
"rewards/reward_format/std": 0.003902346082031727,
"sampling/importance_sampling_ratio/max": 2.5539433479309084,
"sampling/importance_sampling_ratio/mean": 0.9914376139640808,
"sampling/importance_sampling_ratio/min": 0.060658641159534454,
"sampling/sampling_logp_difference/max": 1.0273974418640137,
"sampling/sampling_logp_difference/mean": 0.004290882148779929,
"step": 11820,
"step_time": 7.25341065050161
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1271.2,
"completions/max_terminated_length": 1241.9,
"completions/mean_length": 161.7890625,
"completions/mean_terminated_length": 154.37800140380858,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.0441022815881297,
"epoch": 25.33190578158458,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.2470703125,
"learning_rate": 8.8171e-06,
"loss": -0.0039,
"num_tokens": 1178490410.0,
"reward": 1.0477929770946504,
"reward_std": 0.15210459530353546,
"rewards/reward_accuracy/mean": 0.948046875,
"rewards/reward_accuracy/std": 0.15122396424412726,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.0030663751531392336,
"sampling/importance_sampling_ratio/max": 2.53404324054718,
"sampling/importance_sampling_ratio/mean": 0.9917299687862396,
"sampling/importance_sampling_ratio/min": 0.10408545956015587,
"sampling/sampling_logp_difference/max": 0.9722975611686706,
"sampling/sampling_logp_difference/mean": 0.0041565669933333995,
"step": 11830,
"step_time": 6.283727008593269
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1395.3,
"completions/max_terminated_length": 1188.1,
"completions/mean_length": 154.3375,
"completions/mean_terminated_length": 145.59228973388673,
"completions/min_length": 62.4,
"completions/min_terminated_length": 62.4,
"entropy": 0.0405486473813653,
"epoch": 25.353319057815845,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.451171875,
"learning_rate": 8.8161e-06,
"loss": -0.0071,
"num_tokens": 1179395594.0,
"reward": 1.0672656536102294,
"reward_std": 0.15203482583165168,
"rewards/reward_accuracy/mean": 0.967578125,
"rewards/reward_accuracy/std": 0.1502921961247921,
"rewards/reward_format/mean": 0.09968750178813934,
"rewards/reward_format/std": 0.003483801265247166,
"sampling/importance_sampling_ratio/max": 2.3675787448883057,
"sampling/importance_sampling_ratio/mean": 0.9899256646633148,
"sampling/importance_sampling_ratio/min": 0.11071269363164901,
"sampling/sampling_logp_difference/max": 1.0320440471172332,
"sampling/sampling_logp_difference/mean": 0.003950852225534618,
"step": 11840,
"step_time": 6.718835869888426
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1310.5,
"completions/max_terminated_length": 1206.3,
"completions/mean_length": 153.28203125,
"completions/mean_terminated_length": 145.1484573364258,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.037813770258799194,
"epoch": 25.37473233404711,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.2392578125,
"learning_rate": 8.815100000000001e-06,
"loss": -0.0012,
"num_tokens": 1180305916.0,
"reward": 1.0684961080551147,
"reward_std": 0.14972420036792755,
"rewards/reward_accuracy/mean": 0.96875,
"rewards/reward_accuracy/std": 0.14839933067560196,
"rewards/reward_format/mean": 0.09974609389901161,
"rewards/reward_format/std": 0.0023739393102005122,
"sampling/importance_sampling_ratio/max": 2.450427508354187,
"sampling/importance_sampling_ratio/mean": 0.9861262619495392,
"sampling/importance_sampling_ratio/min": 0.1130578049167525,
"sampling/sampling_logp_difference/max": 0.9610527753829956,
"sampling/sampling_logp_difference/mean": 0.003870393196120858,
"step": 11850,
"step_time": 6.309454314090544
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1195.8,
"completions/max_terminated_length": 1119.6,
"completions/mean_length": 155.59140625,
"completions/mean_terminated_length": 150.45433044433594,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.041029513953253625,
"epoch": 25.396145610278374,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.2578125,
"learning_rate": 8.814100000000001e-06,
"loss": -0.0015,
"num_tokens": 1181223014.0,
"reward": 1.0673437714576721,
"reward_std": 0.12696166038513185,
"rewards/reward_accuracy/mean": 0.967578125,
"rewards/reward_accuracy/std": 0.12598090395331382,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.001963627152144909,
"sampling/importance_sampling_ratio/max": 2.4527623295783996,
"sampling/importance_sampling_ratio/mean": 0.9843600451946258,
"sampling/importance_sampling_ratio/min": 0.13035919852554798,
"sampling/sampling_logp_difference/max": 1.0165546178817748,
"sampling/sampling_logp_difference/mean": 0.004008096852339804,
"step": 11860,
"step_time": 5.963260158995399
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1481.1,
"completions/max_terminated_length": 856.8,
"completions/mean_length": 140.816015625,
"completions/mean_terminated_length": 135.6081558227539,
"completions/min_length": 62.8,
"completions/min_terminated_length": 62.8,
"entropy": 0.03537583530414849,
"epoch": 25.417558886509635,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.30078125,
"learning_rate": 8.8131e-06,
"loss": -0.0078,
"num_tokens": 1182101407.0,
"reward": 1.0748828411102296,
"reward_std": 0.12756555825471877,
"rewards/reward_accuracy/mean": 0.975,
"rewards/reward_accuracy/std": 0.12712220400571822,
"rewards/reward_format/mean": 0.09988281428813935,
"rewards/reward_format/std": 0.0015071487054228784,
"sampling/importance_sampling_ratio/max": 2.357948386669159,
"sampling/importance_sampling_ratio/mean": 0.9985323369503021,
"sampling/importance_sampling_ratio/min": 0.14200379252433776,
"sampling/sampling_logp_difference/max": 0.9147125005722045,
"sampling/sampling_logp_difference/mean": 0.00355046393815428,
"step": 11870,
"step_time": 6.982885360217187
},
{
"clip_ratio/high_max": 1.657835891819559e-05,
"clip_ratio/high_mean": 2.0722948647744486e-06,
"clip_ratio/low_mean": 3.5820723951474067e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.4305021042891896e-06,
"completions/clipped_ratio": 0.013671875,
"completions/max_length": 1445.9,
"completions/max_terminated_length": 1200.7,
"completions/mean_length": 176.878515625,
"completions/mean_terminated_length": 151.31011047363282,
"completions/min_length": 65.7,
"completions/min_terminated_length": 65.7,
"entropy": 0.04915819857269525,
"epoch": 25.4389721627409,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.271484375,
"learning_rate": 8.812100000000002e-06,
"loss": -0.0057,
"num_tokens": 1183067448.0,
"reward": 1.0656836092472077,
"reward_std": 0.1416800282895565,
"rewards/reward_accuracy/mean": 0.966796875,
"rewards/reward_accuracy/std": 0.13829569444060325,
"rewards/reward_format/mean": 0.09888671934604645,
"rewards/reward_format/std": 0.00515456038992852,
"sampling/importance_sampling_ratio/max": 2.701939344406128,
"sampling/importance_sampling_ratio/mean": 0.9946448266506195,
"sampling/importance_sampling_ratio/min": 0.12320302911102772,
"sampling/sampling_logp_difference/max": 0.9673017501831055,
"sampling/sampling_logp_difference/mean": 0.0043388258432969454,
"step": 11880,
"step_time": 7.193997881593532
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1238.6,
"completions/max_terminated_length": 1160.1,
"completions/mean_length": 158.3640625,
"completions/mean_terminated_length": 148.79217834472655,
"completions/min_length": 67.8,
"completions/min_terminated_length": 67.8,
"entropy": 0.04238548080902547,
"epoch": 25.460385438972164,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.404296875,
"learning_rate": 8.8111e-06,
"loss": -0.0068,
"num_tokens": 1183991148.0,
"reward": 1.0562890708446502,
"reward_std": 0.16018104404211045,
"rewards/reward_accuracy/mean": 0.956640625,
"rewards/reward_accuracy/std": 0.15896804332733155,
"rewards/reward_format/mean": 0.09964843839406967,
"rewards/reward_format/std": 0.003496131976135075,
"sampling/importance_sampling_ratio/max": 2.4603914976119996,
"sampling/importance_sampling_ratio/mean": 0.9775571286678314,
"sampling/importance_sampling_ratio/min": 0.13462534844875335,
"sampling/sampling_logp_difference/max": 1.3377642989158631,
"sampling/sampling_logp_difference/mean": 0.0040517274755984545,
"step": 11890,
"step_time": 6.374461749196053
},
{
"clip_ratio/high_max": 1.891074061859399e-05,
"clip_ratio/high_mean": 2.3638425773242488e-06,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.3638425773242488e-06,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1234.4,
"completions/max_terminated_length": 1171.9,
"completions/mean_length": 174.16328125,
"completions/mean_terminated_length": 163.29283599853517,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.04546874447260052,
"epoch": 25.481798715203425,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.1923828125,
"learning_rate": 8.8101e-06,
"loss": -0.0055,
"num_tokens": 1184956894.0,
"reward": 1.0588086128234864,
"reward_std": 0.1531827323138714,
"rewards/reward_accuracy/mean": 0.959375,
"rewards/reward_accuracy/std": 0.1516093872487545,
"rewards/reward_format/mean": 0.09943359494209289,
"rewards/reward_format/std": 0.004315547179430723,
"sampling/importance_sampling_ratio/max": 2.5288573026657106,
"sampling/importance_sampling_ratio/mean": 0.9872206091880799,
"sampling/importance_sampling_ratio/min": 0.09961127638816833,
"sampling/sampling_logp_difference/max": 1.2087453722953796,
"sampling/sampling_logp_difference/mean": 0.004113558423705399,
"step": 11900,
"step_time": 6.452995392802404
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1625.7,
"completions/max_terminated_length": 1435.2,
"completions/mean_length": 156.61328125,
"completions/mean_terminated_length": 151.47765045166017,
"completions/min_length": 66.5,
"completions/min_terminated_length": 66.5,
"entropy": 0.04371105674654245,
"epoch": 25.50321199143469,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.8091e-06,
"loss": -0.0028,
"num_tokens": 1185873696.0,
"reward": 1.0684961080551147,
"reward_std": 0.14874159768223763,
"rewards/reward_accuracy/mean": 0.96875,
"rewards/reward_accuracy/std": 0.14743277803063393,
"rewards/reward_format/mean": 0.09974609538912774,
"rewards/reward_format/std": 0.0030236831167712807,
"sampling/importance_sampling_ratio/max": 2.470234763622284,
"sampling/importance_sampling_ratio/mean": 0.9912668764591217,
"sampling/importance_sampling_ratio/min": 0.12727488875389098,
"sampling/sampling_logp_difference/max": 0.8812731504440308,
"sampling/sampling_logp_difference/mean": 0.004066002205945551,
"step": 11910,
"step_time": 7.8491199426091045
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1685.0,
"completions/max_terminated_length": 1354.6,
"completions/mean_length": 178.99375,
"completions/mean_terminated_length": 165.09283294677735,
"completions/min_length": 62.1,
"completions/min_terminated_length": 62.1,
"entropy": 0.05234497853089124,
"epoch": 25.524625267665954,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.0,
"learning_rate": 8.808100000000001e-06,
"loss": -0.0113,
"num_tokens": 1186852384.0,
"reward": 1.0564453303813934,
"reward_std": 0.17451434582471848,
"rewards/reward_accuracy/mean": 0.95703125,
"rewards/reward_accuracy/std": 0.17270073741674424,
"rewards/reward_format/mean": 0.09941406399011612,
"rewards/reward_format/std": 0.0047294009709730744,
"sampling/importance_sampling_ratio/max": 2.4535470008850098,
"sampling/importance_sampling_ratio/mean": 0.9741080939769745,
"sampling/importance_sampling_ratio/min": 0.08784287869930267,
"sampling/sampling_logp_difference/max": 0.9952268838882447,
"sampling/sampling_logp_difference/mean": 0.004427506471984088,
"step": 11920,
"step_time": 8.207388823392103
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1421.6,
"completions/max_terminated_length": 1232.2,
"completions/mean_length": 156.866796875,
"completions/mean_terminated_length": 150.2494659423828,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.042646641517058013,
"epoch": 25.546038543897215,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0,
"learning_rate": 8.8071e-06,
"loss": -0.0035,
"num_tokens": 1187761467.0,
"reward": 1.0630469024181366,
"reward_std": 0.14363521561026574,
"rewards/reward_accuracy/mean": 0.96328125,
"rewards/reward_accuracy/std": 0.14290751293301582,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0025854269973933698,
"sampling/importance_sampling_ratio/max": 2.4231753826141356,
"sampling/importance_sampling_ratio/mean": 0.9987332403659821,
"sampling/importance_sampling_ratio/min": 0.12928350046277046,
"sampling/sampling_logp_difference/max": 1.0355938911437987,
"sampling/sampling_logp_difference/mean": 0.003983883000910282,
"step": 11930,
"step_time": 6.833438922415371
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1664.6,
"completions/max_terminated_length": 1327.1,
"completions/mean_length": 170.18984375,
"completions/mean_terminated_length": 152.4022994995117,
"completions/min_length": 61.9,
"completions/min_terminated_length": 61.9,
"entropy": 0.048393191979266705,
"epoch": 25.56745182012848,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 8.8061e-06,
"loss": -0.0034,
"num_tokens": 1188713873.0,
"reward": 1.0570703268051147,
"reward_std": 0.175110549479723,
"rewards/reward_accuracy/mean": 0.9578125,
"rewards/reward_accuracy/std": 0.17226947844028473,
"rewards/reward_format/mean": 0.09925781339406967,
"rewards/reward_format/std": 0.0050678560743108395,
"sampling/importance_sampling_ratio/max": 2.501609373092651,
"sampling/importance_sampling_ratio/mean": 0.9766466438770294,
"sampling/importance_sampling_ratio/min": 0.12479749470949172,
"sampling/sampling_logp_difference/max": 0.9157585203647614,
"sampling/sampling_logp_difference/mean": 0.004031814122572541,
"step": 11940,
"step_time": 8.163058222507242
},
{
"clip_ratio/high_max": 2.0800869242521004e-05,
"clip_ratio/high_mean": 2.6001086553151255e-06,
"clip_ratio/low_mean": 1.124809386965353e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.7249180422804786e-06,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1413.9,
"completions/max_terminated_length": 1184.5,
"completions/mean_length": 152.354296875,
"completions/mean_terminated_length": 138.86227951049804,
"completions/min_length": 63.9,
"completions/min_terminated_length": 63.9,
"entropy": 0.04108220350462943,
"epoch": 25.588865096359743,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.805100000000001e-06,
"loss": -0.0066,
"num_tokens": 1189614044.0,
"reward": 1.0721875190734864,
"reward_std": 0.13151646330952643,
"rewards/reward_accuracy/mean": 0.97265625,
"rewards/reward_accuracy/std": 0.12941799685359,
"rewards/reward_format/mean": 0.09953125044703484,
"rewards/reward_format/std": 0.0036006900016218426,
"sampling/importance_sampling_ratio/max": 2.3444603204727175,
"sampling/importance_sampling_ratio/mean": 0.9877211213111877,
"sampling/importance_sampling_ratio/min": 0.15644134487956762,
"sampling/sampling_logp_difference/max": 0.9262092113494873,
"sampling/sampling_logp_difference/mean": 0.0039395801024511455,
"step": 11950,
"step_time": 6.766417934899801
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1845.9,
"completions/max_terminated_length": 1581.0,
"completions/mean_length": 175.413671875,
"completions/mean_terminated_length": 165.15636138916017,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.04888267226051539,
"epoch": 25.610278372591008,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.2255859375,
"learning_rate": 8.804100000000001e-06,
"loss": -0.0024,
"num_tokens": 1190578367.0,
"reward": 1.0602538943290711,
"reward_std": 0.18086153790354728,
"rewards/reward_accuracy/mean": 0.960546875,
"rewards/reward_accuracy/std": 0.17943628653883933,
"rewards/reward_format/mean": 0.09970703050494194,
"rewards/reward_format/std": 0.003706852742470801,
"sampling/importance_sampling_ratio/max": 2.5306654453277586,
"sampling/importance_sampling_ratio/mean": 0.9886077225208283,
"sampling/importance_sampling_ratio/min": 0.1102839132770896,
"sampling/sampling_logp_difference/max": 1.067867934703827,
"sampling/sampling_logp_difference/mean": 0.004097729665227234,
"step": 11960,
"step_time": 8.77679996039078
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1226.6,
"completions/max_terminated_length": 1040.5,
"completions/mean_length": 147.995703125,
"completions/mean_terminated_length": 142.08329010009766,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.03690419178456068,
"epoch": 25.63169164882227,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.96484375,
"learning_rate": 8.8031e-06,
"loss": -0.0047,
"num_tokens": 1191471508.0,
"reward": 1.0778710961341857,
"reward_std": 0.11419631466269493,
"rewards/reward_accuracy/mean": 0.978125,
"rewards/reward_accuracy/std": 0.11314087584614754,
"rewards/reward_format/mean": 0.09974609389901161,
"rewards/reward_format/std": 0.0028042942751199005,
"sampling/importance_sampling_ratio/max": 2.433126389980316,
"sampling/importance_sampling_ratio/mean": 1.0017034232616424,
"sampling/importance_sampling_ratio/min": 0.1366765271872282,
"sampling/sampling_logp_difference/max": 0.9622121095657349,
"sampling/sampling_logp_difference/mean": 0.00379067724570632,
"step": 11970,
"step_time": 6.091338791590533
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1664.4,
"completions/max_terminated_length": 1368.8,
"completions/mean_length": 156.8625,
"completions/mean_terminated_length": 145.14593505859375,
"completions/min_length": 68.8,
"completions/min_terminated_length": 68.8,
"entropy": 0.04440182629041374,
"epoch": 25.653104925053533,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.130859375,
"learning_rate": 8.802100000000002e-06,
"loss": -0.0122,
"num_tokens": 1192385572.0,
"reward": 1.0665625154972076,
"reward_std": 0.13579215214122087,
"rewards/reward_accuracy/mean": 0.9671875,
"rewards/reward_accuracy/std": 0.13220440745353698,
"rewards/reward_format/mean": 0.09937500059604645,
"rewards/reward_format/std": 0.005710632377304137,
"sampling/importance_sampling_ratio/max": 2.4449862480163573,
"sampling/importance_sampling_ratio/mean": 0.9889313042163849,
"sampling/importance_sampling_ratio/min": 0.06811432689428329,
"sampling/sampling_logp_difference/max": 0.9783634066581726,
"sampling/sampling_logp_difference/mean": 0.004095690255053341,
"step": 11980,
"step_time": 7.858888763689902
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1359.2,
"completions/max_terminated_length": 1120.9,
"completions/mean_length": 147.62109375,
"completions/mean_terminated_length": 144.64150848388672,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.03496620522346348,
"epoch": 25.674518201284798,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.263671875,
"learning_rate": 8.8011e-06,
"loss": 0.001,
"num_tokens": 1193283226.0,
"reward": 1.0736914277076721,
"reward_std": 0.11978372707962989,
"rewards/reward_accuracy/mean": 0.973828125,
"rewards/reward_accuracy/std": 0.11821793019771576,
"rewards/reward_format/mean": 0.09986328259110451,
"rewards/reward_format/std": 0.0018196488032117485,
"sampling/importance_sampling_ratio/max": 2.516742634773254,
"sampling/importance_sampling_ratio/mean": 0.9877300262451172,
"sampling/importance_sampling_ratio/min": 0.161397884786129,
"sampling/sampling_logp_difference/max": 1.1675845563411713,
"sampling/sampling_logp_difference/mean": 0.003724909317679703,
"step": 11990,
"step_time": 6.369626894593239
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1010.6,
"completions/max_terminated_length": 801.2,
"completions/mean_length": 141.83671875,
"completions/mean_terminated_length": 139.63023834228517,
"completions/min_length": 67.2,
"completions/min_terminated_length": 67.2,
"entropy": 0.0335579170845449,
"epoch": 25.69593147751606,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.31640625,
"learning_rate": 8.8001e-06,
"loss": -0.0009,
"num_tokens": 1194158440.0,
"reward": 1.0819922089576721,
"reward_std": 0.10269244238734246,
"rewards/reward_accuracy/mean": 0.98203125,
"rewards/reward_accuracy/std": 0.10237024873495101,
"rewards/reward_format/mean": 0.0999609388411045,
"rewards/reward_format/std": 0.0006250000558793544,
"sampling/importance_sampling_ratio/max": 2.3503405809402467,
"sampling/importance_sampling_ratio/mean": 0.9905621469020843,
"sampling/importance_sampling_ratio/min": 0.2263780415058136,
"sampling/sampling_logp_difference/max": 0.8523714482784271,
"sampling/sampling_logp_difference/mean": 0.003583825146779418,
"step": 12000,
"step_time": 4.9750819042878
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1046.6,
"completions/max_terminated_length": 947.7,
"completions/mean_length": 147.6328125,
"completions/mean_terminated_length": 142.4634796142578,
"completions/min_length": 61.2,
"completions/min_terminated_length": 61.2,
"entropy": 0.03837477604392916,
"epoch": 25.717344753747323,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.1875,
"learning_rate": 8.7991e-06,
"loss": -0.0007,
"num_tokens": 1195060508.0,
"reward": 1.0599414229393005,
"reward_std": 0.13943179100751876,
"rewards/reward_accuracy/mean": 0.96015625,
"rewards/reward_accuracy/std": 0.1384761229157448,
"rewards/reward_format/mean": 0.09978515729308128,
"rewards/reward_format/std": 0.0014186207205057143,
"sampling/importance_sampling_ratio/max": 2.42741060256958,
"sampling/importance_sampling_ratio/mean": 0.986524510383606,
"sampling/importance_sampling_ratio/min": 0.14477928653359412,
"sampling/sampling_logp_difference/max": 1.0668604731559754,
"sampling/sampling_logp_difference/mean": 0.003951733303256333,
"step": 12010,
"step_time": 5.056460269584204
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1244.4,
"completions/max_terminated_length": 1052.3,
"completions/mean_length": 167.08671875,
"completions/mean_terminated_length": 159.10772399902345,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.04290738708805293,
"epoch": 25.738758029978587,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.333984375,
"learning_rate": 8.798100000000001e-06,
"loss": -0.0104,
"num_tokens": 1196009242.0,
"reward": 1.0597460985183715,
"reward_std": 0.17107566371560096,
"rewards/reward_accuracy/mean": 0.96015625,
"rewards/reward_accuracy/std": 0.16940135583281518,
"rewards/reward_format/mean": 0.09958984404802322,
"rewards/reward_format/std": 0.00288080929312855,
"sampling/importance_sampling_ratio/max": 2.5696949005126952,
"sampling/importance_sampling_ratio/mean": 0.9947549998760223,
"sampling/importance_sampling_ratio/min": 0.159319781139493,
"sampling/sampling_logp_difference/max": 0.9964356184005737,
"sampling/sampling_logp_difference/mean": 0.004127348819747567,
"step": 12020,
"step_time": 6.288090410205768
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.648249708021467e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.648249708021467e-06,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1644.1,
"completions/max_terminated_length": 1507.7,
"completions/mean_length": 158.511328125,
"completions/mean_terminated_length": 147.43877868652345,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.03817352701444179,
"epoch": 25.76017130620985,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 8.797100000000001e-06,
"loss": -0.0061,
"num_tokens": 1196928695.0,
"reward": 1.078808605670929,
"reward_std": 0.12311058640480041,
"rewards/reward_accuracy/mean": 0.979296875,
"rewards/reward_accuracy/std": 0.121086236089468,
"rewards/reward_format/mean": 0.09951171949505806,
"rewards/reward_format/std": 0.0033198067685589194,
"sampling/importance_sampling_ratio/max": 2.3924288868904116,
"sampling/importance_sampling_ratio/mean": 0.9892319798469543,
"sampling/importance_sampling_ratio/min": 0.13505812138319015,
"sampling/sampling_logp_difference/max": 0.9176177382469177,
"sampling/sampling_logp_difference/mean": 0.003692264575511217,
"step": 12030,
"step_time": 7.755071468892856
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1056.6,
"completions/max_terminated_length": 921.1,
"completions/mean_length": 153.629296875,
"completions/mean_terminated_length": 145.74804458618163,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.03979471505153924,
"epoch": 25.781584582441113,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0,
"learning_rate": 8.7961e-06,
"loss": -0.0018,
"num_tokens": 1197836242.0,
"reward": 1.0696093916893006,
"reward_std": 0.11609085798263549,
"rewards/reward_accuracy/mean": 0.969921875,
"rewards/reward_accuracy/std": 0.11465587168931961,
"rewards/reward_format/mean": 0.09968750104308129,
"rewards/reward_format/std": 0.002866200264543295,
"sampling/importance_sampling_ratio/max": 2.393877649307251,
"sampling/importance_sampling_ratio/mean": 0.9773817598819733,
"sampling/importance_sampling_ratio/min": 0.1715881746262312,
"sampling/sampling_logp_difference/max": 1.236874806880951,
"sampling/sampling_logp_difference/mean": 0.003869947651401162,
"step": 12040,
"step_time": 5.324553306092275
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 974.9,
"completions/max_terminated_length": 822.4,
"completions/mean_length": 145.410546875,
"completions/mean_terminated_length": 141.0195541381836,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.0396014214027673,
"epoch": 25.802997858672377,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.384765625,
"learning_rate": 8.795100000000002e-06,
"loss": 0.0008,
"num_tokens": 1198724125.0,
"reward": 1.072070336341858,
"reward_std": 0.12390252128243447,
"rewards/reward_accuracy/mean": 0.972265625,
"rewards/reward_accuracy/std": 0.12323028594255447,
"rewards/reward_format/mean": 0.09980468899011612,
"rewards/reward_format/std": 0.0016836996655911207,
"sampling/importance_sampling_ratio/max": 2.444932234287262,
"sampling/importance_sampling_ratio/mean": 0.9903107702732086,
"sampling/importance_sampling_ratio/min": 0.1372809436172247,
"sampling/sampling_logp_difference/max": 0.9341431617736816,
"sampling/sampling_logp_difference/mean": 0.0038865472888574004,
"step": 12050,
"step_time": 4.928957121088752
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1283.6,
"completions/max_terminated_length": 1056.8,
"completions/mean_length": 162.83125,
"completions/mean_terminated_length": 153.50847930908202,
"completions/min_length": 60.9,
"completions/min_terminated_length": 60.9,
"entropy": 0.040470474818721416,
"epoch": 25.82441113490364,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.1884765625,
"learning_rate": 8.794100000000001e-06,
"loss": -0.0084,
"num_tokens": 1199658525.0,
"reward": 1.0761328339576721,
"reward_std": 0.09646622687578202,
"rewards/reward_accuracy/mean": 0.9765625,
"rewards/reward_accuracy/std": 0.0947372056543827,
"rewards/reward_format/mean": 0.09957031309604644,
"rewards/reward_format/std": 0.0033640272449702024,
"sampling/importance_sampling_ratio/max": 2.302818942070007,
"sampling/importance_sampling_ratio/mean": 0.9861056268215179,
"sampling/importance_sampling_ratio/min": 0.0858628686517477,
"sampling/sampling_logp_difference/max": 0.9312217354774475,
"sampling/sampling_logp_difference/mean": 0.0038111221976578234,
"step": 12060,
"step_time": 6.268025873898296
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1530.6,
"completions/max_terminated_length": 1299.3,
"completions/mean_length": 161.849609375,
"completions/mean_terminated_length": 150.7718933105469,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.04360262274276465,
"epoch": 25.845824411134902,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.0,
"learning_rate": 8.7931e-06,
"loss": -0.0023,
"num_tokens": 1200592060.0,
"reward": 1.065976583957672,
"reward_std": 0.15373454838991166,
"rewards/reward_accuracy/mean": 0.96640625,
"rewards/reward_accuracy/std": 0.151717422157526,
"rewards/reward_format/mean": 0.09957031309604644,
"rewards/reward_format/std": 0.004801905108615756,
"sampling/importance_sampling_ratio/max": 2.4695406913757325,
"sampling/importance_sampling_ratio/mean": 0.9855437397956848,
"sampling/importance_sampling_ratio/min": 0.07161101922392846,
"sampling/sampling_logp_difference/max": 1.0114525079727172,
"sampling/sampling_logp_difference/mean": 0.004087984724901616,
"step": 12070,
"step_time": 7.392637722499785
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1434.9,
"completions/max_terminated_length": 1340.6,
"completions/mean_length": 155.4125,
"completions/mean_terminated_length": 151.09607849121093,
"completions/min_length": 60.8,
"completions/min_terminated_length": 60.8,
"entropy": 0.04077710388228297,
"epoch": 25.867237687366167,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.09716796875,
"learning_rate": 8.792100000000002e-06,
"loss": -0.007,
"num_tokens": 1201508492.0,
"reward": 1.038867211341858,
"reward_std": 0.1960688576102257,
"rewards/reward_accuracy/mean": 0.9390625,
"rewards/reward_accuracy/std": 0.19560063779354095,
"rewards/reward_format/mean": 0.09980468899011612,
"rewards/reward_format/std": 0.0016597391571849585,
"sampling/importance_sampling_ratio/max": 2.3424597501754763,
"sampling/importance_sampling_ratio/mean": 0.9899987637996673,
"sampling/importance_sampling_ratio/min": 0.06840385273098945,
"sampling/sampling_logp_difference/max": 0.9878079891204834,
"sampling/sampling_logp_difference/mean": 0.0038538005901500583,
"step": 12080,
"step_time": 6.798673671801225
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1303.4,
"completions/max_terminated_length": 1098.0,
"completions/mean_length": 151.298828125,
"completions/mean_terminated_length": 145.40431365966796,
"completions/min_length": 63.1,
"completions/min_terminated_length": 63.1,
"entropy": 0.04255258690100163,
"epoch": 25.88865096359743,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.26171875,
"learning_rate": 8.7911e-06,
"loss": -0.0013,
"num_tokens": 1202413385.0,
"reward": 1.0693164229393006,
"reward_std": 0.14001603573560714,
"rewards/reward_accuracy/mean": 0.96953125,
"rewards/reward_accuracy/std": 0.13941269293427466,
"rewards/reward_format/mean": 0.09978515729308128,
"rewards/reward_format/std": 0.002081228978931904,
"sampling/importance_sampling_ratio/max": 2.6461405515670777,
"sampling/importance_sampling_ratio/mean": 0.9989572465419769,
"sampling/importance_sampling_ratio/min": 0.15476193241775035,
"sampling/sampling_logp_difference/max": 1.0165331363677979,
"sampling/sampling_logp_difference/mean": 0.00396552374586463,
"step": 12090,
"step_time": 6.5264382835943255
},
{
"clip_ratio/high_max": 1.4599392306990921e-05,
"clip_ratio/high_mean": 1.8249240383738651e-06,
"clip_ratio/low_mean": 2.749428176684887e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.099866856042354e-06,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1427.3,
"completions/max_terminated_length": 1140.8,
"completions/mean_length": 167.848828125,
"completions/mean_terminated_length": 151.6149658203125,
"completions/min_length": 61.5,
"completions/min_terminated_length": 61.5,
"entropy": 0.04633849901147187,
"epoch": 25.910064239828692,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.1796875,
"learning_rate": 8.7901e-06,
"loss": -0.0058,
"num_tokens": 1203368454.0,
"reward": 1.0642382979393006,
"reward_std": 0.14629666209220887,
"rewards/reward_accuracy/mean": 0.96484375,
"rewards/reward_accuracy/std": 0.14369165450334548,
"rewards/reward_format/mean": 0.09939453229308129,
"rewards/reward_format/std": 0.004912569141015411,
"sampling/importance_sampling_ratio/max": 2.4639790534973143,
"sampling/importance_sampling_ratio/mean": 0.9846993625164032,
"sampling/importance_sampling_ratio/min": 0.11872156895697117,
"sampling/sampling_logp_difference/max": 0.8629647612571716,
"sampling/sampling_logp_difference/mean": 0.003908737283200026,
"step": 12100,
"step_time": 7.317310862898012
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1525.7,
"completions/max_terminated_length": 1260.5,
"completions/mean_length": 159.67734375,
"completions/mean_terminated_length": 155.3030776977539,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.04506859644316137,
"epoch": 25.931477516059957,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.2890625,
"learning_rate": 8.7891e-06,
"loss": -0.0055,
"num_tokens": 1204294972.0,
"reward": 1.073632836341858,
"reward_std": 0.11591406837105751,
"rewards/reward_accuracy/mean": 0.973828125,
"rewards/reward_accuracy/std": 0.11491752043366432,
"rewards/reward_format/mean": 0.09980468899011612,
"rewards/reward_format/std": 0.002389297354966402,
"sampling/importance_sampling_ratio/max": 2.513824164867401,
"sampling/importance_sampling_ratio/mean": 0.9786620140075684,
"sampling/importance_sampling_ratio/min": 0.16000738963484765,
"sampling/sampling_logp_difference/max": 0.8941989302635193,
"sampling/sampling_logp_difference/mean": 0.003995547699742019,
"step": 12110,
"step_time": 7.107020466087851
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 967.3,
"completions/max_terminated_length": 823.5,
"completions/mean_length": 138.780078125,
"completions/mean_terminated_length": 133.61672821044922,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.03362059383653104,
"epoch": 25.95289079229122,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.0,
"learning_rate": 8.7881e-06,
"loss": -0.0021,
"num_tokens": 1205165129.0,
"reward": 1.0770898580551147,
"reward_std": 0.10713275969028473,
"rewards/reward_accuracy/mean": 0.97734375,
"rewards/reward_accuracy/std": 0.10587414279580117,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.0025652996730059384,
"sampling/importance_sampling_ratio/max": 2.486418902873993,
"sampling/importance_sampling_ratio/mean": 1.005395531654358,
"sampling/importance_sampling_ratio/min": 0.1044683262705803,
"sampling/sampling_logp_difference/max": 0.9438427746295929,
"sampling/sampling_logp_difference/mean": 0.0036120002856478094,
"step": 12120,
"step_time": 5.086235707686865
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1207.2,
"completions/max_terminated_length": 1043.3,
"completions/mean_length": 158.400390625,
"completions/mean_terminated_length": 151.06122894287108,
"completions/min_length": 68.3,
"completions/min_terminated_length": 68.3,
"entropy": 0.041377343237400055,
"epoch": 25.974304068522486,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.44921875,
"learning_rate": 8.787100000000001e-06,
"loss": -0.0061,
"num_tokens": 1206088698.0,
"reward": 1.0783008098602296,
"reward_std": 0.10193045735359192,
"rewards/reward_accuracy/mean": 0.978515625,
"rewards/reward_accuracy/std": 0.10101899951696396,
"rewards/reward_format/mean": 0.09978515729308128,
"rewards/reward_format/std": 0.002305835345759988,
"sampling/importance_sampling_ratio/max": 2.379220151901245,
"sampling/importance_sampling_ratio/mean": 1.0016928255558013,
"sampling/importance_sampling_ratio/min": 0.1668718598783016,
"sampling/sampling_logp_difference/max": 1.1187575459480286,
"sampling/sampling_logp_difference/mean": 0.00399944712407887,
"step": 12130,
"step_time": 5.8274943326920035
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 825.2,
"completions/max_terminated_length": 718.7,
"completions/mean_length": 147.95,
"completions/mean_terminated_length": 147.2075668334961,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.03595429342240095,
"epoch": 25.995717344753746,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0,
"learning_rate": 8.7861e-06,
"loss": -0.0023,
"num_tokens": 1206987130.0,
"reward": 1.0823437690734863,
"reward_std": 0.07584989592432975,
"rewards/reward_accuracy/mean": 0.982421875,
"rewards/reward_accuracy/std": 0.07570586428046226,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.001010174280963838,
"sampling/importance_sampling_ratio/max": 2.4063655495643617,
"sampling/importance_sampling_ratio/mean": 0.9891961872577667,
"sampling/importance_sampling_ratio/min": 0.19960190020501614,
"sampling/sampling_logp_difference/max": 1.0777456045150757,
"sampling/sampling_logp_difference/mean": 0.0037226927699521182,
"step": 12140,
"step_time": 4.16195828380296
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 934.0,
"completions/max_terminated_length": 837.3,
"completions/mean_length": 146.806640625,
"completions/mean_terminated_length": 143.12844543457032,
"completions/min_length": 62.6,
"completions/min_terminated_length": 62.6,
"entropy": 0.03529857504181564,
"epoch": 26.01713062098501,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.78515625,
"learning_rate": 8.785100000000002e-06,
"loss": -0.0024,
"num_tokens": 1207882779.0,
"reward": 1.078710949420929,
"reward_std": 0.11301024332642555,
"rewards/reward_accuracy/mean": 0.97890625,
"rewards/reward_accuracy/std": 0.11185815557837486,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.0023282784037292003,
"sampling/importance_sampling_ratio/max": 2.314428114891052,
"sampling/importance_sampling_ratio/mean": 0.9878997802734375,
"sampling/importance_sampling_ratio/min": 0.1572486382909119,
"sampling/sampling_logp_difference/max": 1.0029527008533479,
"sampling/sampling_logp_difference/mean": 0.003574055409990251,
"step": 12150,
"step_time": 4.806936278997455
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1350.1,
"completions/max_terminated_length": 1090.2,
"completions/mean_length": 152.18046875,
"completions/mean_terminated_length": 146.2762878417969,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.043838734901510176,
"epoch": 26.038543897216275,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.784100000000001e-06,
"loss": -0.0021,
"num_tokens": 1208795129.0,
"reward": 1.0572265803813934,
"reward_std": 0.16438425034284593,
"rewards/reward_accuracy/mean": 0.957421875,
"rewards/reward_accuracy/std": 0.1632570005953312,
"rewards/reward_format/mean": 0.0998046875,
"rewards/reward_format/std": 0.0028851744020357726,
"sampling/importance_sampling_ratio/max": 2.4233500838279722,
"sampling/importance_sampling_ratio/mean": 0.98941969871521,
"sampling/importance_sampling_ratio/min": 0.10446951985359192,
"sampling/sampling_logp_difference/max": 0.8797805964946747,
"sampling/sampling_logp_difference/mean": 0.004076159116812051,
"step": 12160,
"step_time": 6.4978434732940515
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1436.1,
"completions/max_terminated_length": 1205.5,
"completions/mean_length": 153.563671875,
"completions/mean_terminated_length": 149.15679168701172,
"completions/min_length": 60.3,
"completions/min_terminated_length": 60.3,
"entropy": 0.039204225223511455,
"epoch": 26.059957173447536,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.427734375,
"learning_rate": 8.7831e-06,
"loss": -0.0052,
"num_tokens": 1209702492.0,
"reward": 1.051738303899765,
"reward_std": 0.1651543602347374,
"rewards/reward_accuracy/mean": 0.951953125,
"rewards/reward_accuracy/std": 0.16445131748914718,
"rewards/reward_format/mean": 0.09978515803813934,
"rewards/reward_format/std": 0.0028298231307417156,
"sampling/importance_sampling_ratio/max": 2.503934907913208,
"sampling/importance_sampling_ratio/mean": 0.9893038153648377,
"sampling/importance_sampling_ratio/min": 0.1082925109192729,
"sampling/sampling_logp_difference/max": 1.4378623485565185,
"sampling/sampling_logp_difference/mean": 0.003809291892684996,
"step": 12170,
"step_time": 6.705026675097178
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1524.8,
"completions/max_terminated_length": 1379.9,
"completions/mean_length": 167.35234375,
"completions/mean_terminated_length": 160.6967514038086,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.04715702433604747,
"epoch": 26.0813704496788,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.2412109375,
"learning_rate": 8.782100000000002e-06,
"loss": -0.0071,
"num_tokens": 1210652482.0,
"reward": 1.0676562786102295,
"reward_std": 0.1581950344145298,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.15676586031913758,
"rewards/reward_format/mean": 0.09968750178813934,
"rewards/reward_format/std": 0.0036820110166445375,
"sampling/importance_sampling_ratio/max": 2.537967848777771,
"sampling/importance_sampling_ratio/mean": 0.9816321790218353,
"sampling/importance_sampling_ratio/min": 0.038333737751236184,
"sampling/sampling_logp_difference/max": 1.0155826568603517,
"sampling/sampling_logp_difference/mean": 0.004049308644607663,
"step": 12180,
"step_time": 7.3279034621024035
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 884.3,
"completions/max_terminated_length": 698.2,
"completions/mean_length": 144.766796875,
"completions/mean_terminated_length": 138.18765869140626,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.0349934283643961,
"epoch": 26.102783725910065,
"frac_reward_zero_std": 0.975,
"grad_norm": 0.1826171875,
"learning_rate": 8.7811e-06,
"loss": 0.0001,
"num_tokens": 1211533725.0,
"reward": 1.0786328315734863,
"reward_std": 0.08549897968769074,
"rewards/reward_accuracy/mean": 0.97890625,
"rewards/reward_accuracy/std": 0.0842180036008358,
"rewards/reward_format/mean": 0.0997265636920929,
"rewards/reward_format/std": 0.0020054482854902746,
"sampling/importance_sampling_ratio/max": 2.393486213684082,
"sampling/importance_sampling_ratio/mean": 0.9941416800022125,
"sampling/importance_sampling_ratio/min": 0.08767211735248566,
"sampling/sampling_logp_difference/max": 1.044194495677948,
"sampling/sampling_logp_difference/mean": 0.003682044753804803,
"step": 12190,
"step_time": 4.460474273213185
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1065.3,
"completions/max_terminated_length": 1043.2,
"completions/mean_length": 154.24296875,
"completions/mean_terminated_length": 149.83607635498046,
"completions/min_length": 60.1,
"completions/min_terminated_length": 60.1,
"entropy": 0.038621153123676775,
"epoch": 26.124197002141326,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.392578125,
"learning_rate": 8.780100000000001e-06,
"loss": -0.0074,
"num_tokens": 1212445787.0,
"reward": 1.0649805068969727,
"reward_std": 0.1386956512928009,
"rewards/reward_accuracy/mean": 0.965234375,
"rewards/reward_accuracy/std": 0.13778523355722427,
"rewards/reward_format/mean": 0.0997460961341858,
"rewards/reward_format/std": 0.002839757245965302,
"sampling/importance_sampling_ratio/max": 2.41389878988266,
"sampling/importance_sampling_ratio/mean": 0.9833581924438477,
"sampling/importance_sampling_ratio/min": 0.08204820528626441,
"sampling/sampling_logp_difference/max": 0.9503655195236206,
"sampling/sampling_logp_difference/mean": 0.0038269800134003162,
"step": 12200,
"step_time": 5.402214202401228
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 4.091838445674512e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.091838445674512e-06,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1087.1,
"completions/max_terminated_length": 994.0,
"completions/mean_length": 170.42421875,
"completions/mean_terminated_length": 157.22565612792968,
"completions/min_length": 69.7,
"completions/min_terminated_length": 69.7,
"entropy": 0.042590493033640084,
"epoch": 26.14561027837259,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.88671875,
"learning_rate": 8.7791e-06,
"loss": 0.0025,
"num_tokens": 1213398265.0,
"reward": 1.0546093940734864,
"reward_std": 0.15635328292846679,
"rewards/reward_accuracy/mean": 0.955078125,
"rewards/reward_accuracy/std": 0.15490224659442903,
"rewards/reward_format/mean": 0.0995312511920929,
"rewards/reward_format/std": 0.003945704828947782,
"sampling/importance_sampling_ratio/max": 2.5921928882598877,
"sampling/importance_sampling_ratio/mean": 0.9889472961425781,
"sampling/importance_sampling_ratio/min": 0.15684679858386516,
"sampling/sampling_logp_difference/max": 0.9400660991668701,
"sampling/sampling_logp_difference/mean": 0.003934007743373514,
"step": 12210,
"step_time": 5.867537042996264
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1371.2,
"completions/max_terminated_length": 1283.2,
"completions/mean_length": 165.860546875,
"completions/mean_terminated_length": 154.84337310791017,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.04371531689539552,
"epoch": 26.167023554603855,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.375,
"learning_rate": 8.7781e-06,
"loss": -0.0098,
"num_tokens": 1214343812.0,
"reward": 1.0781054854393006,
"reward_std": 0.10630985975731164,
"rewards/reward_accuracy/mean": 0.978515625,
"rewards/reward_accuracy/std": 0.10433763042092323,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.003804926644079387,
"sampling/importance_sampling_ratio/max": 2.5389504432678223,
"sampling/importance_sampling_ratio/mean": 0.9885791838169098,
"sampling/importance_sampling_ratio/min": 0.08598119094967842,
"sampling/sampling_logp_difference/max": 1.150672471523285,
"sampling/sampling_logp_difference/mean": 0.004095316701568663,
"step": 12220,
"step_time": 6.608685268601403
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1046.7,
"completions/max_terminated_length": 865.3,
"completions/mean_length": 140.716796875,
"completions/mean_terminated_length": 138.51365814208984,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.032907421025447546,
"epoch": 26.18843683083512,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.341796875,
"learning_rate": 8.777100000000001e-06,
"loss": -0.002,
"num_tokens": 1215222399.0,
"reward": 1.0714453279972076,
"reward_std": 0.10492733344435692,
"rewards/reward_accuracy/mean": 0.971484375,
"rewards/reward_accuracy/std": 0.10471491515636444,
"rewards/reward_format/mean": 0.09996093809604645,
"rewards/reward_format/std": 0.0006250000093132258,
"sampling/importance_sampling_ratio/max": 2.3573646068573,
"sampling/importance_sampling_ratio/mean": 0.988016563653946,
"sampling/importance_sampling_ratio/min": 0.1939452588558197,
"sampling/sampling_logp_difference/max": 1.0267325520515442,
"sampling/sampling_logp_difference/mean": 0.0034798224922269584,
"step": 12230,
"step_time": 5.09276962998847
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 986.4,
"completions/max_terminated_length": 847.3,
"completions/mean_length": 153.49140625,
"completions/mean_terminated_length": 146.1175323486328,
"completions/min_length": 67.4,
"completions/min_terminated_length": 67.4,
"entropy": 0.03652338783722371,
"epoch": 26.20985010706638,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.6328125,
"learning_rate": 8.7761e-06,
"loss": -0.0052,
"num_tokens": 1216135369.0,
"reward": 1.0729101836681365,
"reward_std": 0.11730492636561393,
"rewards/reward_accuracy/mean": 0.973046875,
"rewards/reward_accuracy/std": 0.11677989438176155,
"rewards/reward_format/mean": 0.09986328333616257,
"rewards/reward_format/std": 0.001160451816394925,
"sampling/importance_sampling_ratio/max": 2.4979592084884645,
"sampling/importance_sampling_ratio/mean": 0.9855316817760468,
"sampling/importance_sampling_ratio/min": 0.20774319767951965,
"sampling/sampling_logp_difference/max": 1.0204104959964753,
"sampling/sampling_logp_difference/mean": 0.003531388915143907,
"step": 12240,
"step_time": 5.1979655420029305
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1360.5,
"completions/max_terminated_length": 971.9,
"completions/mean_length": 166.665625,
"completions/mean_terminated_length": 152.79630966186522,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.04045761455781758,
"epoch": 26.231263383297645,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.326171875,
"learning_rate": 8.7751e-06,
"loss": -0.0066,
"num_tokens": 1217081089.0,
"reward": 1.049101573228836,
"reward_std": 0.18279007747769355,
"rewards/reward_accuracy/mean": 0.949609375,
"rewards/reward_accuracy/std": 0.18089283630251884,
"rewards/reward_format/mean": 0.09949218705296517,
"rewards/reward_format/std": 0.004152385843917727,
"sampling/importance_sampling_ratio/max": 2.49436901807785,
"sampling/importance_sampling_ratio/mean": 0.9950692653656006,
"sampling/importance_sampling_ratio/min": 0.13291847109794616,
"sampling/sampling_logp_difference/max": 0.9670830249786377,
"sampling/sampling_logp_difference/mean": 0.0038822263712063433,
"step": 12250,
"step_time": 6.7696867876074975
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1170.0,
"completions/max_terminated_length": 919.0,
"completions/mean_length": 156.180078125,
"completions/mean_terminated_length": 150.29322967529296,
"completions/min_length": 67.6,
"completions/min_terminated_length": 67.6,
"entropy": 0.03870732388459146,
"epoch": 26.25267665952891,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.1435546875,
"learning_rate": 8.774100000000001e-06,
"loss": -0.0058,
"num_tokens": 1217998734.0,
"reward": 1.0721093893051148,
"reward_std": 0.12832644656300546,
"rewards/reward_accuracy/mean": 0.972265625,
"rewards/reward_accuracy/std": 0.12765310257673262,
"rewards/reward_format/mean": 0.09984375089406967,
"rewards/reward_format/std": 0.0018717264058068395,
"sampling/importance_sampling_ratio/max": 2.5277549982070924,
"sampling/importance_sampling_ratio/mean": 0.9791035950183868,
"sampling/importance_sampling_ratio/min": 0.05124288587830961,
"sampling/sampling_logp_difference/max": 0.9946103811264038,
"sampling/sampling_logp_difference/mean": 0.00392341308761388,
"step": 12260,
"step_time": 5.786616774398135
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1221.5,
"completions/max_terminated_length": 1052.3,
"completions/mean_length": 165.276953125,
"completions/mean_terminated_length": 160.23460998535157,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.046976796281524,
"epoch": 26.27408993576017,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.85546875,
"learning_rate": 8.7731e-06,
"loss": -0.0017,
"num_tokens": 1218939459.0,
"reward": 1.06181640625,
"reward_std": 0.15274574384093284,
"rewards/reward_accuracy/mean": 0.962109375,
"rewards/reward_accuracy/std": 0.15179651379585266,
"rewards/reward_format/mean": 0.09970703125,
"rewards/reward_format/std": 0.0032461997354403136,
"sampling/importance_sampling_ratio/max": 2.47417151927948,
"sampling/importance_sampling_ratio/mean": 0.9908146023750305,
"sampling/importance_sampling_ratio/min": 0.11189937628805638,
"sampling/sampling_logp_difference/max": 1.0169397115707397,
"sampling/sampling_logp_difference/mean": 0.004128515487536788,
"step": 12270,
"step_time": 5.969527482413104
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1105.3,
"completions/max_terminated_length": 1013.8,
"completions/mean_length": 160.396875,
"completions/mean_terminated_length": 153.79608001708985,
"completions/min_length": 67.9,
"completions/min_terminated_length": 67.9,
"entropy": 0.0444668655982241,
"epoch": 26.295503211991434,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.39453125,
"learning_rate": 8.772100000000002e-06,
"loss": -0.0015,
"num_tokens": 1219877179.0,
"reward": 1.0524219036102296,
"reward_std": 0.15550099089741706,
"rewards/reward_accuracy/mean": 0.952734375,
"rewards/reward_accuracy/std": 0.1542256958782673,
"rewards/reward_format/mean": 0.09968750178813934,
"rewards/reward_format/std": 0.0023995240218937395,
"sampling/importance_sampling_ratio/max": 2.5485652685165405,
"sampling/importance_sampling_ratio/mean": 0.9948742747306824,
"sampling/importance_sampling_ratio/min": 0.15772012211382389,
"sampling/sampling_logp_difference/max": 0.9441527009010315,
"sampling/sampling_logp_difference/mean": 0.0044183837017044425,
"step": 12280,
"step_time": 5.551159683891456
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0140625,
"completions/max_length": 1348.0,
"completions/max_terminated_length": 1216.9,
"completions/mean_length": 172.219140625,
"completions/mean_terminated_length": 145.63107147216797,
"completions/min_length": 62.5,
"completions/min_terminated_length": 62.5,
"entropy": 0.04493699714075774,
"epoch": 26.3169164882227,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.095703125,
"learning_rate": 8.7711e-06,
"loss": -0.0111,
"num_tokens": 1220833436.0,
"reward": 1.066699206829071,
"reward_std": 0.14140581265091895,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.1370720736682415,
"rewards/reward_format/mean": 0.09873046875,
"rewards/reward_format/std": 0.006663049734197557,
"sampling/importance_sampling_ratio/max": 2.6518245697021485,
"sampling/importance_sampling_ratio/mean": 0.9868613660335541,
"sampling/importance_sampling_ratio/min": 0.0855546984821558,
"sampling/sampling_logp_difference/max": 0.9734989881515503,
"sampling/sampling_logp_difference/mean": 0.0040317477192729715,
"step": 12290,
"step_time": 7.064980581088458
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1002.0,
"completions/max_terminated_length": 963.0,
"completions/mean_length": 151.039453125,
"completions/mean_terminated_length": 146.5934600830078,
"completions/min_length": 61.2,
"completions/min_terminated_length": 61.2,
"entropy": 0.03686216827481985,
"epoch": 26.338329764453963,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.63671875,
"learning_rate": 8.770100000000001e-06,
"loss": -0.006,
"num_tokens": 1221741265.0,
"reward": 1.0799609541893005,
"reward_std": 0.10325764641165733,
"rewards/reward_accuracy/mean": 0.980078125,
"rewards/reward_accuracy/std": 0.10271594002842903,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.0014512486523017287,
"sampling/importance_sampling_ratio/max": 2.5033171653747557,
"sampling/importance_sampling_ratio/mean": 0.9908162295818329,
"sampling/importance_sampling_ratio/min": 0.1818249755539,
"sampling/sampling_logp_difference/max": 1.269659161567688,
"sampling/sampling_logp_difference/mean": 0.0037687526317313315,
"step": 12300,
"step_time": 5.199348248090246
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1255.5,
"completions/max_terminated_length": 1218.5,
"completions/mean_length": 158.552734375,
"completions/mean_terminated_length": 154.9083679199219,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.04197882283478975,
"epoch": 26.359743040685224,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.4296875,
"learning_rate": 8.7691e-06,
"loss": -0.0023,
"num_tokens": 1222668872.0,
"reward": 1.0731640696525573,
"reward_std": 0.12011473700404167,
"rewards/reward_accuracy/mean": 0.9734375,
"rewards/reward_accuracy/std": 0.1191465549170971,
"rewards/reward_format/mean": 0.09972656294703483,
"rewards/reward_format/std": 0.0031545268604531882,
"sampling/importance_sampling_ratio/max": 2.3462109208106994,
"sampling/importance_sampling_ratio/mean": 0.9881298065185546,
"sampling/importance_sampling_ratio/min": 0.09586685448884964,
"sampling/sampling_logp_difference/max": 0.9291199088096619,
"sampling/sampling_logp_difference/mean": 0.003808252140879631,
"step": 12310,
"step_time": 6.505314668198116
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1053.9,
"completions/max_terminated_length": 826.9,
"completions/mean_length": 156.1171875,
"completions/mean_terminated_length": 148.79876556396485,
"completions/min_length": 61.3,
"completions/min_terminated_length": 61.3,
"entropy": 0.04025881108827889,
"epoch": 26.38115631691649,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.294921875,
"learning_rate": 8.7681e-06,
"loss": -0.0027,
"num_tokens": 1223584980.0,
"reward": 1.0782617568969726,
"reward_std": 0.10669357404112816,
"rewards/reward_accuracy/mean": 0.978515625,
"rewards/reward_accuracy/std": 0.10499731600284576,
"rewards/reward_format/mean": 0.0997460961341858,
"rewards/reward_format/std": 0.002967783063650131,
"sampling/importance_sampling_ratio/max": 2.2552119374275206,
"sampling/importance_sampling_ratio/mean": 0.9670266032218933,
"sampling/importance_sampling_ratio/min": 0.0756349615752697,
"sampling/sampling_logp_difference/max": 1.2123970448970796,
"sampling/sampling_logp_difference/mean": 0.003868602099828422,
"step": 12320,
"step_time": 5.373678523412673
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1007.8,
"completions/max_terminated_length": 1007.8,
"completions/mean_length": 150.640234375,
"completions/mean_terminated_length": 147.01289978027344,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.036407649819739166,
"epoch": 26.402569593147753,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.767100000000001e-06,
"loss": -0.0056,
"num_tokens": 1224489371.0,
"reward": 1.072851586341858,
"reward_std": 0.10787632241845131,
"rewards/reward_accuracy/mean": 0.973046875,
"rewards/reward_accuracy/std": 0.10733399763703347,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.001386538054794073,
"sampling/importance_sampling_ratio/max": 2.4954495191574098,
"sampling/importance_sampling_ratio/mean": 0.9969067573547363,
"sampling/importance_sampling_ratio/min": 0.09298726096749306,
"sampling/sampling_logp_difference/max": 1.123026955127716,
"sampling/sampling_logp_difference/mean": 0.0036216030828654768,
"step": 12330,
"step_time": 5.070852906213259
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1098.9,
"completions/max_terminated_length": 990.2,
"completions/mean_length": 154.1890625,
"completions/mean_terminated_length": 149.75619812011718,
"completions/min_length": 62.0,
"completions/min_terminated_length": 62.0,
"entropy": 0.042044031573459505,
"epoch": 26.423982869379014,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.08984375,
"learning_rate": 8.7661e-06,
"loss": 0.0011,
"num_tokens": 1225398431.0,
"reward": 1.0607812762260438,
"reward_std": 0.14071731641888618,
"rewards/reward_accuracy/mean": 0.9609375,
"rewards/reward_accuracy/std": 0.14026115238666534,
"rewards/reward_format/mean": 0.09984375238418579,
"rewards/reward_format/std": 0.0016451086848974228,
"sampling/importance_sampling_ratio/max": 2.4224223732948302,
"sampling/importance_sampling_ratio/mean": 1.000346940755844,
"sampling/importance_sampling_ratio/min": 0.2372343759983778,
"sampling/sampling_logp_difference/max": 0.8810962915420533,
"sampling/sampling_logp_difference/mean": 0.003859837702475488,
"step": 12340,
"step_time": 5.5041486566944515
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1066.0,
"completions/max_terminated_length": 943.5,
"completions/mean_length": 153.286328125,
"completions/mean_terminated_length": 146.68606872558593,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.039775332692079245,
"epoch": 26.445396145610278,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.75,
"learning_rate": 8.7651e-06,
"loss": -0.0082,
"num_tokens": 1226312108.0,
"reward": 1.0638476729393005,
"reward_std": 0.16381946429610253,
"rewards/reward_accuracy/mean": 0.9640625,
"rewards/reward_accuracy/std": 0.16274105608463288,
"rewards/reward_format/mean": 0.09978515729308128,
"rewards/reward_format/std": 0.0020693443948403,
"sampling/importance_sampling_ratio/max": 2.4367723941802977,
"sampling/importance_sampling_ratio/mean": 0.9895189881324769,
"sampling/importance_sampling_ratio/min": 0.20397286750376226,
"sampling/sampling_logp_difference/max": 0.9768446862697602,
"sampling/sampling_logp_difference/mean": 0.0038900688057765366,
"step": 12350,
"step_time": 5.530660236210679
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1007.5,
"completions/max_terminated_length": 900.4,
"completions/mean_length": 145.12265625,
"completions/mean_terminated_length": 139.99685821533203,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.036715060379356144,
"epoch": 26.466809421841543,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.6015625,
"learning_rate": 8.764100000000001e-06,
"loss": -0.0041,
"num_tokens": 1227201862.0,
"reward": 1.0802148580551147,
"reward_std": 0.08781383410096169,
"rewards/reward_accuracy/mean": 0.98046875,
"rewards/reward_accuracy/std": 0.08681524321436881,
"rewards/reward_format/mean": 0.09974609389901161,
"rewards/reward_format/std": 0.0023240381153300403,
"sampling/importance_sampling_ratio/max": 2.413503646850586,
"sampling/importance_sampling_ratio/mean": 0.9965579092502594,
"sampling/importance_sampling_ratio/min": 0.2627452680841088,
"sampling/sampling_logp_difference/max": 0.8534047722816467,
"sampling/sampling_logp_difference/mean": 0.0036680999444797637,
"step": 12360,
"step_time": 5.245371717083617
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1138.1,
"completions/max_terminated_length": 1013.5,
"completions/mean_length": 149.16640625,
"completions/mean_terminated_length": 146.21238403320314,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.038320995634421706,
"epoch": 26.488222698072803,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.1650390625,
"learning_rate": 8.763100000000001e-06,
"loss": -0.0129,
"num_tokens": 1228106816.0,
"reward": 1.0795312643051147,
"reward_std": 0.12253917157649993,
"rewards/reward_accuracy/mean": 0.9796875,
"rewards/reward_accuracy/std": 0.12165729925036431,
"rewards/reward_format/mean": 0.09984375089406967,
"rewards/reward_format/std": 0.001433100108988583,
"sampling/importance_sampling_ratio/max": 2.2065266132354737,
"sampling/importance_sampling_ratio/mean": 0.9893871903419494,
"sampling/importance_sampling_ratio/min": 0.1299258515238762,
"sampling/sampling_logp_difference/max": 0.9474000334739685,
"sampling/sampling_logp_difference/mean": 0.0038745679659768937,
"step": 12370,
"step_time": 5.455263001695857
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.7463984654095837e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.7463984654095837e-06,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 954.4,
"completions/max_terminated_length": 905.2,
"completions/mean_length": 155.859765625,
"completions/mean_terminated_length": 144.20159454345702,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.03945601866580546,
"epoch": 26.509635974304068,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.443359375,
"learning_rate": 8.7621e-06,
"loss": -0.0038,
"num_tokens": 1229029545.0,
"reward": 1.053300803899765,
"reward_std": 0.1633882276713848,
"rewards/reward_accuracy/mean": 0.95390625,
"rewards/reward_accuracy/std": 0.16181822791695594,
"rewards/reward_format/mean": 0.09939453229308129,
"rewards/reward_format/std": 0.003522482328116894,
"sampling/importance_sampling_ratio/max": 2.5729261875152587,
"sampling/importance_sampling_ratio/mean": 0.988648283481598,
"sampling/importance_sampling_ratio/min": 0.1430075654760003,
"sampling/sampling_logp_difference/max": 1.2842639327049254,
"sampling/sampling_logp_difference/mean": 0.003994761104695499,
"step": 12380,
"step_time": 5.273472530808067
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1466.0,
"completions/max_terminated_length": 971.4,
"completions/mean_length": 162.184765625,
"completions/mean_terminated_length": 151.2773094177246,
"completions/min_length": 61.5,
"completions/min_terminated_length": 61.5,
"entropy": 0.04293962914962322,
"epoch": 26.531049250535332,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.761100000000002e-06,
"loss": -0.0021,
"num_tokens": 1229957522.0,
"reward": 1.071289074420929,
"reward_std": 0.12242392897605896,
"rewards/reward_accuracy/mean": 0.971875,
"rewards/reward_accuracy/std": 0.11918618530035019,
"rewards/reward_format/mean": 0.09941406324505805,
"rewards/reward_format/std": 0.004192538745701313,
"sampling/importance_sampling_ratio/max": 2.2534302711486816,
"sampling/importance_sampling_ratio/mean": 0.9841293811798095,
"sampling/importance_sampling_ratio/min": 0.14863759875297547,
"sampling/sampling_logp_difference/max": 0.9403617203235626,
"sampling/sampling_logp_difference/mean": 0.003936977335251867,
"step": 12390,
"step_time": 7.262316273487523
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 715.8,
"completions/max_terminated_length": 524.7,
"completions/mean_length": 130.616015625,
"completions/mean_terminated_length": 129.12578125,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.032162893051281574,
"epoch": 26.552462526766597,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.0,
"learning_rate": 8.760100000000001e-06,
"loss": -0.0043,
"num_tokens": 1230807835.0,
"reward": 1.0885937690734864,
"reward_std": 0.06408443525433541,
"rewards/reward_accuracy/mean": 0.988671875,
"rewards/reward_accuracy/std": 0.06370269730687142,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.0012500001117587089,
"sampling/importance_sampling_ratio/max": 2.349313259124756,
"sampling/importance_sampling_ratio/mean": 0.9954762876033783,
"sampling/importance_sampling_ratio/min": 0.2044969793409109,
"sampling/sampling_logp_difference/max": 0.8222860872745514,
"sampling/sampling_logp_difference/mean": 0.003473619627766311,
"step": 12400,
"step_time": 3.851185482388246
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 874.0,
"completions/max_terminated_length": 691.2,
"completions/mean_length": 142.622265625,
"completions/mean_terminated_length": 141.14975280761718,
"completions/min_length": 63.9,
"completions/min_terminated_length": 63.9,
"entropy": 0.03437666515819728,
"epoch": 26.573875802997858,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.7591e-06,
"loss": -0.0062,
"num_tokens": 1231688180.0,
"reward": 1.0585156440734864,
"reward_std": 0.15503219068050383,
"rewards/reward_accuracy/mean": 0.95859375,
"rewards/reward_accuracy/std": 0.1547996684908867,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.0010660743806511163,
"sampling/importance_sampling_ratio/max": 2.3614357590675352,
"sampling/importance_sampling_ratio/mean": 0.9885070443153381,
"sampling/importance_sampling_ratio/min": 0.19192293286323547,
"sampling/sampling_logp_difference/max": 1.0203614830970764,
"sampling/sampling_logp_difference/mean": 0.003620158135890961,
"step": 12410,
"step_time": 4.541580902007991
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1093.6,
"completions/max_terminated_length": 878.1,
"completions/mean_length": 159.172265625,
"completions/mean_terminated_length": 145.9892150878906,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.038824328244663774,
"epoch": 26.595289079229122,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.60546875,
"learning_rate": 8.7581e-06,
"loss": -0.0024,
"num_tokens": 1232610797.0,
"reward": 1.0626172065734862,
"reward_std": 0.14756816774606704,
"rewards/reward_accuracy/mean": 0.96328125,
"rewards/reward_accuracy/std": 0.14500498101115228,
"rewards/reward_format/mean": 0.0993359386920929,
"rewards/reward_format/std": 0.0037766341120004654,
"sampling/importance_sampling_ratio/max": 2.5134023666381835,
"sampling/importance_sampling_ratio/mean": 0.9935387015342713,
"sampling/importance_sampling_ratio/min": 0.15108220875263215,
"sampling/sampling_logp_difference/max": 0.8867518663406372,
"sampling/sampling_logp_difference/mean": 0.003786539426073432,
"step": 12420,
"step_time": 5.447569780884078
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1373.7,
"completions/max_terminated_length": 1033.4,
"completions/mean_length": 152.51015625,
"completions/mean_terminated_length": 147.35665435791014,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.03607139973901212,
"epoch": 26.616702355460387,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.39453125,
"learning_rate": 8.757100000000001e-06,
"loss": -0.0016,
"num_tokens": 1233520295.0,
"reward": 1.0795312643051147,
"reward_std": 0.11025769710540771,
"rewards/reward_accuracy/mean": 0.9796875,
"rewards/reward_accuracy/std": 0.1088766686618328,
"rewards/reward_format/mean": 0.09984375089406967,
"rewards/reward_format/std": 0.0025000002235174177,
"sampling/importance_sampling_ratio/max": 2.394242024421692,
"sampling/importance_sampling_ratio/mean": 0.9964451014995575,
"sampling/importance_sampling_ratio/min": 0.16418154388666154,
"sampling/sampling_logp_difference/max": 0.9119309663772583,
"sampling/sampling_logp_difference/mean": 0.0036114776507019998,
"step": 12430,
"step_time": 6.710873871197691
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 976.9,
"completions/max_terminated_length": 971.7,
"completions/mean_length": 154.055078125,
"completions/mean_terminated_length": 149.01740264892578,
"completions/min_length": 68.1,
"completions/min_terminated_length": 68.1,
"entropy": 0.03592993763741106,
"epoch": 26.638115631691647,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.6171875,
"learning_rate": 8.7561e-06,
"loss": -0.0047,
"num_tokens": 1234437028.0,
"reward": 1.0524804949760438,
"reward_std": 0.15732893720269203,
"rewards/reward_accuracy/mean": 0.952734375,
"rewards/reward_accuracy/std": 0.1566301740705967,
"rewards/reward_format/mean": 0.09974609538912774,
"rewards/reward_format/std": 0.0014799259603023528,
"sampling/importance_sampling_ratio/max": 2.398430609703064,
"sampling/importance_sampling_ratio/mean": 0.9946850657463073,
"sampling/importance_sampling_ratio/min": 0.060870404541492465,
"sampling/sampling_logp_difference/max": 0.9430308043956757,
"sampling/sampling_logp_difference/mean": 0.0036812452832236885,
"step": 12440,
"step_time": 5.037132385504083
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1199.5,
"completions/max_terminated_length": 1128.5,
"completions/mean_length": 157.94375,
"completions/mean_terminated_length": 155.05777282714843,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.03448065186385065,
"epoch": 26.659528907922912,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.1953125,
"learning_rate": 8.7551e-06,
"loss": -0.0003,
"num_tokens": 1235360484.0,
"reward": 1.0685937702655792,
"reward_std": 0.1300741344690323,
"rewards/reward_accuracy/mean": 0.96875,
"rewards/reward_accuracy/std": 0.12961409538984298,
"rewards/reward_format/mean": 0.09984375089406967,
"rewards/reward_format/std": 0.0017032783478498458,
"sampling/importance_sampling_ratio/max": 2.5228188276290893,
"sampling/importance_sampling_ratio/mean": 0.992971134185791,
"sampling/importance_sampling_ratio/min": 0.12482931688427926,
"sampling/sampling_logp_difference/max": 1.0106429576873779,
"sampling/sampling_logp_difference/mean": 0.0035012348322197794,
"step": 12450,
"step_time": 5.766961950281984
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1535.6,
"completions/max_terminated_length": 1276.3,
"completions/mean_length": 163.809375,
"completions/mean_terminated_length": 149.05001373291014,
"completions/min_length": 59.3,
"completions/min_terminated_length": 59.3,
"entropy": 0.04547620269004256,
"epoch": 26.680942184154176,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.15625,
"learning_rate": 8.754100000000001e-06,
"loss": -0.0039,
"num_tokens": 1236293980.0,
"reward": 1.0416211128234862,
"reward_std": 0.18832831531763078,
"rewards/reward_accuracy/mean": 0.9421875,
"rewards/reward_accuracy/std": 0.18657757192850113,
"rewards/reward_format/mean": 0.09943359568715096,
"rewards/reward_format/std": 0.0050520160468295215,
"sampling/importance_sampling_ratio/max": 2.5924160957336424,
"sampling/importance_sampling_ratio/mean": 0.9800851881504059,
"sampling/importance_sampling_ratio/min": 0.04723439327790402,
"sampling/sampling_logp_difference/max": 1.6306010723114013,
"sampling/sampling_logp_difference/mean": 0.0040724987629801035,
"step": 12460,
"step_time": 7.504733093088726
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 896.8,
"completions/max_terminated_length": 743.3,
"completions/mean_length": 141.13984375,
"completions/mean_terminated_length": 136.0074249267578,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.03395155109465122,
"epoch": 26.70235546038544,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.353515625,
"learning_rate": 8.753100000000001e-06,
"loss": -0.0042,
"num_tokens": 1237168434.0,
"reward": 1.0623046994209289,
"reward_std": 0.1493423268198967,
"rewards/reward_accuracy/mean": 0.9625,
"rewards/reward_accuracy/std": 0.14849163666367532,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.0020581001648679377,
"sampling/importance_sampling_ratio/max": 2.3524025321006774,
"sampling/importance_sampling_ratio/mean": 0.9887143731117248,
"sampling/importance_sampling_ratio/min": 0.12985782697796822,
"sampling/sampling_logp_difference/max": 1.062021827697754,
"sampling/sampling_logp_difference/mean": 0.0037421176210045816,
"step": 12470,
"step_time": 4.610083013924305
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1460.9,
"completions/max_terminated_length": 1228.6,
"completions/mean_length": 154.451953125,
"completions/mean_terminated_length": 147.12101211547852,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"entropy": 0.04216480951290578,
"epoch": 26.7237687366167,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.28125,
"learning_rate": 8.7521e-06,
"loss": -0.0054,
"num_tokens": 1238084679.0,
"reward": 1.0589258074760437,
"reward_std": 0.15367091596126556,
"rewards/reward_accuracy/mean": 0.959375,
"rewards/reward_accuracy/std": 0.1521575190126896,
"rewards/reward_format/mean": 0.09955078363418579,
"rewards/reward_format/std": 0.004506619577296078,
"sampling/importance_sampling_ratio/max": 2.2722039580345155,
"sampling/importance_sampling_ratio/mean": 0.9774537265300751,
"sampling/importance_sampling_ratio/min": 0.09351519979536534,
"sampling/sampling_logp_difference/max": 1.1750441670417786,
"sampling/sampling_logp_difference/mean": 0.0041163360700011255,
"step": 12480,
"step_time": 7.022788007889176
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1709.9,
"completions/max_terminated_length": 1108.0,
"completions/mean_length": 156.63828125,
"completions/mean_terminated_length": 147.826570892334,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.04441691676620394,
"epoch": 26.745182012847966,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.0732421875,
"learning_rate": 8.751100000000002e-06,
"loss": -0.005,
"num_tokens": 1239003097.0,
"reward": 1.0742968797683716,
"reward_std": 0.1430821366608143,
"rewards/reward_accuracy/mean": 0.974609375,
"rewards/reward_accuracy/std": 0.14167148917913436,
"rewards/reward_format/mean": 0.09968750029802323,
"rewards/reward_format/std": 0.0032109312480315564,
"sampling/importance_sampling_ratio/max": 2.221213436126709,
"sampling/importance_sampling_ratio/mean": 0.9863013625144958,
"sampling/importance_sampling_ratio/min": 0.09998914487659931,
"sampling/sampling_logp_difference/max": 1.0491844952106475,
"sampling/sampling_logp_difference/mean": 0.004147821827791632,
"step": 12490,
"step_time": 7.977676786581287
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1198.8,
"completions/max_terminated_length": 865.8,
"completions/mean_length": 157.05625,
"completions/mean_terminated_length": 149.69935455322266,
"completions/min_length": 63.1,
"completions/min_terminated_length": 63.1,
"entropy": 0.036611161986365916,
"epoch": 26.76659528907923,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.166015625,
"learning_rate": 8.7501e-06,
"loss": -0.0016,
"num_tokens": 1239911929.0,
"reward": 1.0543554902076722,
"reward_std": 0.16683889031410218,
"rewards/reward_accuracy/mean": 0.9546875,
"rewards/reward_accuracy/std": 0.16516389399766923,
"rewards/reward_format/mean": 0.09966797009110451,
"rewards/reward_format/std": 0.0036379231372848154,
"sampling/importance_sampling_ratio/max": 2.47730633020401,
"sampling/importance_sampling_ratio/mean": 0.9908472895622253,
"sampling/importance_sampling_ratio/min": 0.10780540108680725,
"sampling/sampling_logp_difference/max": 1.0801722168922425,
"sampling/sampling_logp_difference/mean": 0.0037483282620087268,
"step": 12500,
"step_time": 5.9421808173123285
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1751.5,
"completions/max_terminated_length": 1233.7,
"completions/mean_length": 161.50703125,
"completions/mean_terminated_length": 147.53360595703126,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.040897570643574,
"epoch": 26.78800856531049,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.7491e-06,
"loss": -0.0095,
"num_tokens": 1240841275.0,
"reward": 1.068457043170929,
"reward_std": 0.14408271461725236,
"rewards/reward_accuracy/mean": 0.969140625,
"rewards/reward_accuracy/std": 0.14020903035998344,
"rewards/reward_format/mean": 0.09931640699505806,
"rewards/reward_format/std": 0.005671476386487484,
"sampling/importance_sampling_ratio/max": 2.3774197697639465,
"sampling/importance_sampling_ratio/mean": 0.979960823059082,
"sampling/importance_sampling_ratio/min": 0.06089931428432464,
"sampling/sampling_logp_difference/max": 0.9012146592140198,
"sampling/sampling_logp_difference/mean": 0.0038418506272137167,
"step": 12510,
"step_time": 8.23584835640213
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1212.0,
"completions/max_terminated_length": 1085.7,
"completions/mean_length": 151.11171875,
"completions/mean_terminated_length": 144.46448516845703,
"completions/min_length": 69.9,
"completions/min_terminated_length": 69.9,
"entropy": 0.03824645222630352,
"epoch": 26.809421841541756,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.154296875,
"learning_rate": 8.7481e-06,
"loss": -0.0045,
"num_tokens": 1241741161.0,
"reward": 1.0719140648841858,
"reward_std": 0.12033685550559312,
"rewards/reward_accuracy/mean": 0.972265625,
"rewards/reward_accuracy/std": 0.11855541691184043,
"rewards/reward_format/mean": 0.09964843764901161,
"rewards/reward_format/std": 0.003571730898693204,
"sampling/importance_sampling_ratio/max": 2.3988327622413634,
"sampling/importance_sampling_ratio/mean": 0.9876061916351319,
"sampling/importance_sampling_ratio/min": 0.18179123066365718,
"sampling/sampling_logp_difference/max": 0.8713419616222382,
"sampling/sampling_logp_difference/mean": 0.00386557353194803,
"step": 12520,
"step_time": 5.933028789696982
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1230.8,
"completions/max_terminated_length": 997.2,
"completions/mean_length": 165.785546875,
"completions/mean_terminated_length": 161.41994018554686,
"completions/min_length": 70.2,
"completions/min_terminated_length": 70.2,
"entropy": 0.04431989637669176,
"epoch": 26.83083511777302,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.74609375,
"learning_rate": 8.747100000000001e-06,
"loss": -0.0066,
"num_tokens": 1242691524.0,
"reward": 1.059199231863022,
"reward_std": 0.14951584488153458,
"rewards/reward_accuracy/mean": 0.959375,
"rewards/reward_accuracy/std": 0.14852575808763505,
"rewards/reward_format/mean": 0.0998242199420929,
"rewards/reward_format/std": 0.002444648859091103,
"sampling/importance_sampling_ratio/max": 2.395486283302307,
"sampling/importance_sampling_ratio/mean": 0.9768068134784699,
"sampling/importance_sampling_ratio/min": 0.15542591996490956,
"sampling/sampling_logp_difference/max": 0.9531604051589966,
"sampling/sampling_logp_difference/mean": 0.003986434871330857,
"step": 12530,
"step_time": 6.237728268303909
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1200.2,
"completions/max_terminated_length": 1059.9,
"completions/mean_length": 167.57421875,
"completions/mean_terminated_length": 158.16651000976563,
"completions/min_length": 66.4,
"completions/min_terminated_length": 66.4,
"entropy": 0.04235132755711675,
"epoch": 26.85224839400428,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.072265625,
"learning_rate": 8.7461e-06,
"loss": -0.0088,
"num_tokens": 1243642002.0,
"reward": 1.0687304854393005,
"reward_std": 0.1254809595644474,
"rewards/reward_accuracy/mean": 0.969140625,
"rewards/reward_accuracy/std": 0.12331953719258308,
"rewards/reward_format/mean": 0.09958984404802322,
"rewards/reward_format/std": 0.003828571387566626,
"sampling/importance_sampling_ratio/max": 2.3722012400627137,
"sampling/importance_sampling_ratio/mean": 0.9811906278133392,
"sampling/importance_sampling_ratio/min": 0.12491670325398445,
"sampling/sampling_logp_difference/max": 1.0072677969932555,
"sampling/sampling_logp_difference/mean": 0.003897653496824205,
"step": 12540,
"step_time": 6.350971611309797
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 908.7,
"completions/max_terminated_length": 872.5,
"completions/mean_length": 139.47265625,
"completions/mean_terminated_length": 137.98615264892578,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.03596659882459789,
"epoch": 26.873661670235546,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.220703125,
"learning_rate": 8.7451e-06,
"loss": -0.0045,
"num_tokens": 1244517356.0,
"reward": 1.0929296970367433,
"reward_std": 0.05886864543426782,
"rewards/reward_accuracy/mean": 0.99296875,
"rewards/reward_accuracy/std": 0.0584512785077095,
"rewards/reward_format/mean": 0.09996093809604645,
"rewards/reward_format/std": 0.0006250000093132258,
"sampling/importance_sampling_ratio/max": 2.2622291803359986,
"sampling/importance_sampling_ratio/mean": 0.995643424987793,
"sampling/importance_sampling_ratio/min": 0.12222468256950378,
"sampling/sampling_logp_difference/max": 1.1259133398532868,
"sampling/sampling_logp_difference/mean": 0.0037219708086922766,
"step": 12550,
"step_time": 4.648831791122211
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1036.8,
"completions/max_terminated_length": 1009.8,
"completions/mean_length": 148.539453125,
"completions/mean_terminated_length": 145.5690719604492,
"completions/min_length": 61.6,
"completions/min_terminated_length": 61.6,
"entropy": 0.036352154426276685,
"epoch": 26.89507494646681,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.744100000000002e-06,
"loss": -0.0006,
"num_tokens": 1245417905.0,
"reward": 1.0748242378234862,
"reward_std": 0.11272718459367752,
"rewards/reward_accuracy/mean": 0.975,
"rewards/reward_accuracy/std": 0.11176888942718506,
"rewards/reward_format/mean": 0.0998242199420929,
"rewards/reward_format/std": 0.001944400672800839,
"sampling/importance_sampling_ratio/max": 2.5015812158584594,
"sampling/importance_sampling_ratio/mean": 0.9950766026973724,
"sampling/importance_sampling_ratio/min": 0.15715850740671158,
"sampling/sampling_logp_difference/max": 0.900447428226471,
"sampling/sampling_logp_difference/mean": 0.0037660690024495123,
"step": 12560,
"step_time": 5.176354477807763
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 893.5,
"completions/max_terminated_length": 742.3,
"completions/mean_length": 145.93515625,
"completions/mean_terminated_length": 139.3190887451172,
"completions/min_length": 65.7,
"completions/min_terminated_length": 65.7,
"entropy": 0.03750852071680129,
"epoch": 26.916488222698074,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.2431640625,
"learning_rate": 8.743100000000001e-06,
"loss": -0.0049,
"num_tokens": 1246305531.0,
"reward": 1.0815234541893006,
"reward_std": 0.10220926105976105,
"rewards/reward_accuracy/mean": 0.981640625,
"rewards/reward_accuracy/std": 0.1017054483294487,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.0009831610135734082,
"sampling/importance_sampling_ratio/max": 2.400411868095398,
"sampling/importance_sampling_ratio/mean": 0.9903962135314941,
"sampling/importance_sampling_ratio/min": 0.14868990909308194,
"sampling/sampling_logp_difference/max": 1.03043475151062,
"sampling/sampling_logp_difference/mean": 0.003823703504167497,
"step": 12570,
"step_time": 4.737543996423483
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1496.5,
"completions/max_terminated_length": 1351.5,
"completions/mean_length": 153.1390625,
"completions/mean_terminated_length": 148.70567016601564,
"completions/min_length": 62.8,
"completions/min_terminated_length": 62.8,
"entropy": 0.039669132535345854,
"epoch": 26.937901498929335,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.7421e-06,
"loss": -0.0008,
"num_tokens": 1247216031.0,
"reward": 1.067734384536743,
"reward_std": 0.14608059376478194,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.14510635957121848,
"rewards/reward_format/mean": 0.09976562559604644,
"rewards/reward_format/std": 0.002492625406011939,
"sampling/importance_sampling_ratio/max": 2.4313813209533692,
"sampling/importance_sampling_ratio/mean": 0.978470242023468,
"sampling/importance_sampling_ratio/min": 0.12788924174383282,
"sampling/sampling_logp_difference/max": 0.892998218536377,
"sampling/sampling_logp_difference/mean": 0.003796715522184968,
"step": 12580,
"step_time": 7.154904514417285
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 4.2955325625371187e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.2955325625371187e-07,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1053.3,
"completions/max_terminated_length": 862.2,
"completions/mean_length": 156.812890625,
"completions/mean_terminated_length": 148.1324462890625,
"completions/min_length": 65.7,
"completions/min_terminated_length": 65.7,
"entropy": 0.03871748391538858,
"epoch": 26.9593147751606,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.1416015625,
"learning_rate": 8.741100000000002e-06,
"loss": -0.0047,
"num_tokens": 1248136048.0,
"reward": 1.0672265827655791,
"reward_std": 0.132164104282856,
"rewards/reward_accuracy/mean": 0.967578125,
"rewards/reward_accuracy/std": 0.13090885505080224,
"rewards/reward_format/mean": 0.09964843839406967,
"rewards/reward_format/std": 0.0029746270971372723,
"sampling/importance_sampling_ratio/max": 2.448600733280182,
"sampling/importance_sampling_ratio/mean": 1.0037270367145539,
"sampling/importance_sampling_ratio/min": 0.13781668581068515,
"sampling/sampling_logp_difference/max": 0.9139571905136108,
"sampling/sampling_logp_difference/mean": 0.003892198484390974,
"step": 12590,
"step_time": 5.175322593990131
},
{
"clip_ratio/high_max": 1.1665889178402723e-05,
"clip_ratio/high_mean": 1.4582361473003403e-06,
"clip_ratio/low_mean": 1.0936771104752551e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.5519132577755952e-06,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1567.1,
"completions/max_terminated_length": 1443.8,
"completions/mean_length": 169.248046875,
"completions/mean_terminated_length": 152.23634490966796,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.04537316833157092,
"epoch": 26.980728051391864,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.203125,
"learning_rate": 8.7401e-06,
"loss": -0.0043,
"num_tokens": 1249079851.0,
"reward": 1.0683593928813935,
"reward_std": 0.13314120694994927,
"rewards/reward_accuracy/mean": 0.969140625,
"rewards/reward_accuracy/std": 0.1296163745224476,
"rewards/reward_format/mean": 0.09921875074505807,
"rewards/reward_format/std": 0.005329701700247824,
"sampling/importance_sampling_ratio/max": 2.594748067855835,
"sampling/importance_sampling_ratio/mean": 0.9878929853439331,
"sampling/importance_sampling_ratio/min": 0.0634825199842453,
"sampling/sampling_logp_difference/max": 0.999093770980835,
"sampling/sampling_logp_difference/mean": 0.004022311372682452,
"step": 12600,
"step_time": 7.832228617699002
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 756.7,
"completions/max_terminated_length": 585.4,
"completions/mean_length": 141.49375,
"completions/mean_terminated_length": 140.7431610107422,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.033015654026530686,
"epoch": 27.002141327623125,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.380859375,
"learning_rate": 8.7391e-06,
"loss": 0.001,
"num_tokens": 1249959931.0,
"reward": 1.0835351705551148,
"reward_std": 0.09276851743925363,
"rewards/reward_accuracy/mean": 0.98359375,
"rewards/reward_accuracy/std": 0.09200436919927597,
"rewards/reward_format/mean": 0.09994140714406967,
"rewards/reward_format/std": 0.0009375000605359674,
"sampling/importance_sampling_ratio/max": 2.1254823923110964,
"sampling/importance_sampling_ratio/mean": 0.9795442938804626,
"sampling/importance_sampling_ratio/min": 0.20092845857143402,
"sampling/sampling_logp_difference/max": 0.9932573318481446,
"sampling/sampling_logp_difference/mean": 0.0036618191516026855,
"step": 12610,
"step_time": 3.895666364187491
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1222.4,
"completions/max_terminated_length": 1036.7,
"completions/mean_length": 152.915625,
"completions/mean_terminated_length": 147.8524528503418,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.03741874429397285,
"epoch": 27.02355460385439,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.7381e-06,
"loss": -0.0028,
"num_tokens": 1250866131.0,
"reward": 1.0855273604393005,
"reward_std": 0.08079418689012527,
"rewards/reward_accuracy/mean": 0.9859375,
"rewards/reward_accuracy/std": 0.07865023091435433,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.0030176589265465737,
"sampling/importance_sampling_ratio/max": 2.3872847676277162,
"sampling/importance_sampling_ratio/mean": 0.9911778807640076,
"sampling/importance_sampling_ratio/min": 0.18369950577616692,
"sampling/sampling_logp_difference/max": 0.9442965090274811,
"sampling/sampling_logp_difference/mean": 0.003740156185813248,
"step": 12620,
"step_time": 5.969954165580566
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1252.8,
"completions/max_terminated_length": 1150.9,
"completions/mean_length": 151.401953125,
"completions/mean_terminated_length": 149.91536407470704,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"entropy": 0.038987696263939144,
"epoch": 27.044967880085654,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 8.7371e-06,
"loss": -0.0012,
"num_tokens": 1251767032.0,
"reward": 1.0846289277076722,
"reward_std": 0.09437214061617852,
"rewards/reward_accuracy/mean": 0.984765625,
"rewards/reward_accuracy/std": 0.09354534074664116,
"rewards/reward_format/mean": 0.09986328259110451,
"rewards/reward_format/std": 0.0017004600027576088,
"sampling/importance_sampling_ratio/max": 2.616628861427307,
"sampling/importance_sampling_ratio/mean": 0.9908076643943786,
"sampling/importance_sampling_ratio/min": 0.10434326641261578,
"sampling/sampling_logp_difference/max": 1.4801496982574462,
"sampling/sampling_logp_difference/mean": 0.003930504014715552,
"step": 12630,
"step_time": 6.027730936591979
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1170.5,
"completions/max_terminated_length": 935.8,
"completions/mean_length": 149.39609375,
"completions/mean_terminated_length": 145.0401397705078,
"completions/min_length": 62.3,
"completions/min_terminated_length": 62.3,
"entropy": 0.03784103207290172,
"epoch": 27.066381156316915,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.736100000000001e-06,
"loss": -0.0002,
"num_tokens": 1252658878.0,
"reward": 1.07470703125,
"reward_std": 0.09832794740796089,
"rewards/reward_accuracy/mean": 0.975,
"rewards/reward_accuracy/std": 0.09716628417372704,
"rewards/reward_format/mean": 0.09970703125,
"rewards/reward_format/std": 0.002443419257178903,
"sampling/importance_sampling_ratio/max": 2.343415987491608,
"sampling/importance_sampling_ratio/mean": 0.9966915249824524,
"sampling/importance_sampling_ratio/min": 0.22118260860443115,
"sampling/sampling_logp_difference/max": 0.8338399887084961,
"sampling/sampling_logp_difference/mean": 0.003574965172447264,
"step": 12640,
"step_time": 5.800673530809581
},
{
"clip_ratio/high_max": 2.152079323423095e-05,
"clip_ratio/high_mean": 2.6900991542788686e-06,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.6900991542788686e-06,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1297.2,
"completions/max_terminated_length": 1155.8,
"completions/mean_length": 162.199609375,
"completions/mean_terminated_length": 151.38792724609374,
"completions/min_length": 65.3,
"completions/min_terminated_length": 65.3,
"entropy": 0.04313916501123458,
"epoch": 27.08779443254818,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.484375,
"learning_rate": 8.7351e-06,
"loss": -0.0052,
"num_tokens": 1253596397.0,
"reward": 1.0558203220367433,
"reward_std": 0.177667810767889,
"rewards/reward_accuracy/mean": 0.95625,
"rewards/reward_accuracy/std": 0.176446433365345,
"rewards/reward_format/mean": 0.09957031309604644,
"rewards/reward_format/std": 0.0033186885761097074,
"sampling/importance_sampling_ratio/max": 2.5675207495689394,
"sampling/importance_sampling_ratio/mean": 0.9884207427501679,
"sampling/importance_sampling_ratio/min": 0.14339400604367256,
"sampling/sampling_logp_difference/max": 0.9342005848884583,
"sampling/sampling_logp_difference/mean": 0.003933656751178205,
"step": 12650,
"step_time": 6.556514323106967
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1281.4,
"completions/max_terminated_length": 1105.2,
"completions/mean_length": 168.37734375,
"completions/mean_terminated_length": 155.25613708496093,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.042566988174803554,
"epoch": 27.109207708779444,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.11767578125,
"learning_rate": 8.734100000000002e-06,
"loss": -0.0124,
"num_tokens": 1254547299.0,
"reward": 1.0725781321525574,
"reward_std": 0.1404448129236698,
"rewards/reward_accuracy/mean": 0.973046875,
"rewards/reward_accuracy/std": 0.13832568973302842,
"rewards/reward_format/mean": 0.0995312511920929,
"rewards/reward_format/std": 0.003294321708381176,
"sampling/importance_sampling_ratio/max": 2.4121355533599855,
"sampling/importance_sampling_ratio/mean": 0.9827308773994445,
"sampling/importance_sampling_ratio/min": 0.0970441535115242,
"sampling/sampling_logp_difference/max": 0.9467766046524048,
"sampling/sampling_logp_difference/mean": 0.003840688127093017,
"step": 12660,
"step_time": 6.582177033997141
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1628.2,
"completions/max_terminated_length": 1273.0,
"completions/mean_length": 161.863671875,
"completions/mean_terminated_length": 150.8149200439453,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.04377062781713903,
"epoch": 27.130620985010708,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.08447265625,
"learning_rate": 8.733100000000001e-06,
"loss": -0.0068,
"num_tokens": 1255482230.0,
"reward": 1.0737890720367431,
"reward_std": 0.1324259139597416,
"rewards/reward_accuracy/mean": 0.97421875,
"rewards/reward_accuracy/std": 0.12973487228155137,
"rewards/reward_format/mean": 0.09957031309604644,
"rewards/reward_format/std": 0.004555970896035433,
"sampling/importance_sampling_ratio/max": 2.379637575149536,
"sampling/importance_sampling_ratio/mean": 0.989645802974701,
"sampling/importance_sampling_ratio/min": 0.07791546862572432,
"sampling/sampling_logp_difference/max": 1.3067884564399719,
"sampling/sampling_logp_difference/mean": 0.0041132632875815036,
"step": 12670,
"step_time": 7.835086093205609
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1256.6,
"completions/max_terminated_length": 1199.4,
"completions/mean_length": 153.048046875,
"completions/mean_terminated_length": 147.20110778808595,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.040592874656431376,
"epoch": 27.15203426124197,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.06689453125,
"learning_rate": 8.7321e-06,
"loss": -0.0095,
"num_tokens": 1256390001.0,
"reward": 1.0751172184944153,
"reward_std": 0.11913535073399543,
"rewards/reward_accuracy/mean": 0.975390625,
"rewards/reward_accuracy/std": 0.11809398084878922,
"rewards/reward_format/mean": 0.09972656518220901,
"rewards/reward_format/std": 0.0025229052640497684,
"sampling/importance_sampling_ratio/max": 2.5709001302719114,
"sampling/importance_sampling_ratio/mean": 0.9744259059429169,
"sampling/importance_sampling_ratio/min": 0.14029985219240187,
"sampling/sampling_logp_difference/max": 0.9188993215560913,
"sampling/sampling_logp_difference/mean": 0.003984051733277738,
"step": 12680,
"step_time": 6.150481138189207
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1039.2,
"completions/max_terminated_length": 986.9,
"completions/mean_length": 146.940625,
"completions/mean_terminated_length": 142.52227935791015,
"completions/min_length": 65.7,
"completions/min_terminated_length": 65.7,
"entropy": 0.03531296192668378,
"epoch": 27.173447537473233,
"frac_reward_zero_std": 0.96875,
"grad_norm": 0.0,
"learning_rate": 8.731100000000002e-06,
"loss": 0.0004,
"num_tokens": 1257285065.0,
"reward": 1.0657617449760437,
"reward_std": 0.12681491822004318,
"rewards/reward_accuracy/mean": 0.966015625,
"rewards/reward_accuracy/std": 0.12570650205016137,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.002084212377667427,
"sampling/importance_sampling_ratio/max": 2.4101922869682313,
"sampling/importance_sampling_ratio/mean": 0.9943255007266998,
"sampling/importance_sampling_ratio/min": 0.11139898300170899,
"sampling/sampling_logp_difference/max": 1.064814466238022,
"sampling/sampling_logp_difference/mean": 0.003666867036372423,
"step": 12690,
"step_time": 5.182913194075809
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1134.9,
"completions/max_terminated_length": 938.9,
"completions/mean_length": 146.337890625,
"completions/mean_terminated_length": 138.94182891845702,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.03877810484264046,
"epoch": 27.194860813704498,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.38671875,
"learning_rate": 8.7301e-06,
"loss": -0.0041,
"num_tokens": 1258170538.0,
"reward": 1.088085949420929,
"reward_std": 0.07675795704126358,
"rewards/reward_accuracy/mean": 0.98828125,
"rewards/reward_accuracy/std": 0.07569829672574997,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.0023282783105969427,
"sampling/importance_sampling_ratio/max": 2.3432676553726197,
"sampling/importance_sampling_ratio/mean": 0.9823654472827912,
"sampling/importance_sampling_ratio/min": 0.17276358529925345,
"sampling/sampling_logp_difference/max": 0.9855234384536743,
"sampling/sampling_logp_difference/mean": 0.003789245360530913,
"step": 12700,
"step_time": 5.645123153802706
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1098.3,
"completions/max_terminated_length": 1044.1,
"completions/mean_length": 164.57109375,
"completions/mean_terminated_length": 158.16814575195312,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.04517072003800422,
"epoch": 27.21627408993576,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.7291e-06,
"loss": -0.0007,
"num_tokens": 1259110800.0,
"reward": 1.0648633003234864,
"reward_std": 0.11799062117934227,
"rewards/reward_accuracy/mean": 0.965234375,
"rewards/reward_accuracy/std": 0.11677624061703681,
"rewards/reward_format/mean": 0.09962890669703484,
"rewards/reward_format/std": 0.002955902274698019,
"sampling/importance_sampling_ratio/max": 2.5384440422058105,
"sampling/importance_sampling_ratio/mean": 0.9750185191631318,
"sampling/importance_sampling_ratio/min": 0.1156343549489975,
"sampling/sampling_logp_difference/max": 1.1596896827220917,
"sampling/sampling_logp_difference/mean": 0.004214121052064002,
"step": 12710,
"step_time": 5.548443765129195
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1519.7,
"completions/max_terminated_length": 1215.4,
"completions/mean_length": 144.851953125,
"completions/mean_terminated_length": 141.8869758605957,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.03902824022807181,
"epoch": 27.237687366167023,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.07470703125,
"learning_rate": 8.7281e-06,
"loss": -0.0049,
"num_tokens": 1259993173.0,
"reward": 1.0701171875,
"reward_std": 0.13645949095953255,
"rewards/reward_accuracy/mean": 0.9703125,
"rewards/reward_accuracy/std": 0.13478140532970428,
"rewards/reward_format/mean": 0.0998046875,
"rewards/reward_format/std": 0.0028851744486019016,
"sampling/importance_sampling_ratio/max": 2.4020063638687135,
"sampling/importance_sampling_ratio/mean": 0.9766020715236664,
"sampling/importance_sampling_ratio/min": 0.08764459751546383,
"sampling/sampling_logp_difference/max": 1.15885751247406,
"sampling/sampling_logp_difference/mean": 0.004108287859708071,
"step": 12720,
"step_time": 7.046374456712511
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1154.2,
"completions/max_terminated_length": 1027.8,
"completions/mean_length": 147.90078125,
"completions/mean_terminated_length": 146.42324981689453,
"completions/min_length": 68.1,
"completions/min_terminated_length": 68.1,
"entropy": 0.03492811780888587,
"epoch": 27.259100642398288,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.1875,
"learning_rate": 8.7271e-06,
"loss": -0.0051,
"num_tokens": 1260884615.0,
"reward": 1.0886523604393006,
"reward_std": 0.08693512305617332,
"rewards/reward_accuracy/mean": 0.988671875,
"rewards/reward_accuracy/std": 0.08675243258476258,
"rewards/reward_format/mean": 0.09998046979308128,
"rewards/reward_format/std": 0.0003125000046566129,
"sampling/importance_sampling_ratio/max": 2.538546252250671,
"sampling/importance_sampling_ratio/mean": 0.9995150744915009,
"sampling/importance_sampling_ratio/min": 0.152553915604949,
"sampling/sampling_logp_difference/max": 1.0667690873146056,
"sampling/sampling_logp_difference/mean": 0.003553827665746212,
"step": 12730,
"step_time": 5.596068940477562
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1273.1,
"completions/max_terminated_length": 1025.1,
"completions/mean_length": 168.466015625,
"completions/mean_terminated_length": 161.09353637695312,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.0445972881745547,
"epoch": 27.280513918629552,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.259765625,
"learning_rate": 8.726100000000001e-06,
"loss": -0.0044,
"num_tokens": 1261838288.0,
"reward": 1.060156273841858,
"reward_std": 0.17145940959453582,
"rewards/reward_accuracy/mean": 0.960546875,
"rewards/reward_accuracy/std": 0.1699141502380371,
"rewards/reward_format/mean": 0.099609375,
"rewards/reward_format/std": 0.003291428554803133,
"sampling/importance_sampling_ratio/max": 2.470018243789673,
"sampling/importance_sampling_ratio/mean": 0.9739997088909149,
"sampling/importance_sampling_ratio/min": 0.08972264947369694,
"sampling/sampling_logp_difference/max": 1.138592493534088,
"sampling/sampling_logp_difference/mean": 0.004157774965278804,
"step": 12740,
"step_time": 6.297122117783874
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1542.9,
"completions/max_terminated_length": 1183.1,
"completions/mean_length": 160.730078125,
"completions/mean_terminated_length": 154.87540130615236,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.038804725464433434,
"epoch": 27.301927194860813,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.42578125,
"learning_rate": 8.7251e-06,
"loss": -0.0064,
"num_tokens": 1262770013.0,
"reward": 1.0618750035762787,
"reward_std": 0.1540781132876873,
"rewards/reward_accuracy/mean": 0.962109375,
"rewards/reward_accuracy/std": 0.15283758714795112,
"rewards/reward_format/mean": 0.09976562559604644,
"rewards/reward_format/std": 0.003382148826494813,
"sampling/importance_sampling_ratio/max": 2.600006127357483,
"sampling/importance_sampling_ratio/mean": 0.992150217294693,
"sampling/importance_sampling_ratio/min": 0.13363812416791915,
"sampling/sampling_logp_difference/max": 0.9493774116039276,
"sampling/sampling_logp_difference/mean": 0.00381937799975276,
"step": 12750,
"step_time": 7.376244885701453
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 999.6,
"completions/max_terminated_length": 653.7,
"completions/mean_length": 163.5375,
"completions/mean_terminated_length": 148.45287857055663,
"completions/min_length": 62.5,
"completions/min_terminated_length": 62.5,
"entropy": 0.04118309880141169,
"epoch": 27.323340471092077,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.724100000000002e-06,
"loss": 0.0027,
"num_tokens": 1263708429.0,
"reward": 1.0656054973602296,
"reward_std": 0.14155273884534836,
"rewards/reward_accuracy/mean": 0.96640625,
"rewards/reward_accuracy/std": 0.13851695507764816,
"rewards/reward_format/mean": 0.09919922053813934,
"rewards/reward_format/std": 0.004369343211874366,
"sampling/importance_sampling_ratio/max": 2.6202195644378663,
"sampling/importance_sampling_ratio/mean": 0.9919298887252808,
"sampling/importance_sampling_ratio/min": 0.13869542367756366,
"sampling/sampling_logp_difference/max": 0.9790866255760193,
"sampling/sampling_logp_difference/mean": 0.003965315618552267,
"step": 12760,
"step_time": 5.426574337319471
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 4.118699234822998e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.118699234822998e-06,
"completions/clipped_ratio": 0.016796875,
"completions/max_length": 1744.9,
"completions/max_terminated_length": 1400.2,
"completions/mean_length": 196.7828125,
"completions/mean_terminated_length": 165.45030670166017,
"completions/min_length": 65.7,
"completions/min_terminated_length": 65.7,
"entropy": 0.05540991288144141,
"epoch": 27.34475374732334,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.2412109375,
"learning_rate": 8.723100000000001e-06,
"loss": -0.009,
"num_tokens": 1264733137.0,
"reward": 1.0476367354393006,
"reward_std": 0.2017641119658947,
"rewards/reward_accuracy/mean": 0.948828125,
"rewards/reward_accuracy/std": 0.1968064233660698,
"rewards/reward_format/mean": 0.09880859479308128,
"rewards/reward_format/std": 0.008334906143136322,
"sampling/importance_sampling_ratio/max": 2.606825041770935,
"sampling/importance_sampling_ratio/mean": 0.982547914981842,
"sampling/importance_sampling_ratio/min": 0.07794667892158032,
"sampling/sampling_logp_difference/max": 1.0564493417739869,
"sampling/sampling_logp_difference/mean": 0.004149502888321876,
"step": 12770,
"step_time": 8.765828663867433
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1083.1,
"completions/max_terminated_length": 810.4,
"completions/mean_length": 162.18671875,
"completions/mean_terminated_length": 154.93186264038087,
"completions/min_length": 69.1,
"completions/min_terminated_length": 69.1,
"entropy": 0.034416544274426995,
"epoch": 27.366167023554603,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.173828125,
"learning_rate": 8.7221e-06,
"loss": -0.0013,
"num_tokens": 1265668943.0,
"reward": 1.0711328387260437,
"reward_std": 0.10339382290840149,
"rewards/reward_accuracy/mean": 0.971484375,
"rewards/reward_accuracy/std": 0.10216421782970428,
"rewards/reward_format/mean": 0.09964843764901161,
"rewards/reward_format/std": 0.0025979126105085014,
"sampling/importance_sampling_ratio/max": 2.463323736190796,
"sampling/importance_sampling_ratio/mean": 0.9980034530162811,
"sampling/importance_sampling_ratio/min": 0.17565926313400268,
"sampling/sampling_logp_difference/max": 1.1034145474433898,
"sampling/sampling_logp_difference/mean": 0.0035987000679597258,
"step": 12780,
"step_time": 5.53087471431063
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1268.3,
"completions/max_terminated_length": 997.9,
"completions/mean_length": 157.555078125,
"completions/mean_terminated_length": 151.0261001586914,
"completions/min_length": 69.6,
"completions/min_terminated_length": 69.6,
"entropy": 0.03917536155786365,
"epoch": 27.387580299785867,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.091796875,
"learning_rate": 8.721100000000002e-06,
"loss": -0.0007,
"num_tokens": 1266592636.0,
"reward": 1.0755273640155791,
"reward_std": 0.10647519454360008,
"rewards/reward_accuracy/mean": 0.97578125,
"rewards/reward_accuracy/std": 0.10524587109684944,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.002930835448205471,
"sampling/importance_sampling_ratio/max": 2.4980194568634033,
"sampling/importance_sampling_ratio/mean": 0.998951119184494,
"sampling/importance_sampling_ratio/min": 0.16540272091515362,
"sampling/sampling_logp_difference/max": 0.9176171898841858,
"sampling/sampling_logp_difference/mean": 0.0039039979921653865,
"step": 12790,
"step_time": 6.087584705484915
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1163.4,
"completions/max_terminated_length": 1047.0,
"completions/mean_length": 149.30625,
"completions/mean_terminated_length": 142.6831787109375,
"completions/min_length": 64.7,
"completions/min_terminated_length": 64.7,
"entropy": 0.03573997465427965,
"epoch": 27.40899357601713,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.7201e-06,
"loss": -0.0046,
"num_tokens": 1267495116.0,
"reward": 1.0665234684944154,
"reward_std": 0.13323281928896905,
"rewards/reward_accuracy/mean": 0.966796875,
"rewards/reward_accuracy/std": 0.13218051791191102,
"rewards/reward_format/mean": 0.09972656443715096,
"rewards/reward_format/std": 0.002630585338920355,
"sampling/importance_sampling_ratio/max": 2.5397798657417296,
"sampling/importance_sampling_ratio/mean": 0.9863304972648621,
"sampling/importance_sampling_ratio/min": 0.13576938733458518,
"sampling/sampling_logp_difference/max": 1.1261970162391663,
"sampling/sampling_logp_difference/mean": 0.0036212291568517687,
"step": 12800,
"step_time": 5.718709624497569
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1208.0,
"completions/max_terminated_length": 1022.6,
"completions/mean_length": 158.78359375,
"completions/mean_terminated_length": 144.76617279052735,
"completions/min_length": 64.4,
"completions/min_terminated_length": 64.4,
"entropy": 0.04100178647786379,
"epoch": 27.430406852248392,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.08740234375,
"learning_rate": 8.719100000000001e-06,
"loss": -0.0015,
"num_tokens": 1268414658.0,
"reward": 1.0680859565734864,
"reward_std": 0.13716922253370284,
"rewards/reward_accuracy/mean": 0.96875,
"rewards/reward_accuracy/std": 0.13394855782389642,
"rewards/reward_format/mean": 0.09933593720197678,
"rewards/reward_format/std": 0.004946434707380831,
"sampling/importance_sampling_ratio/max": 2.4093140840530394,
"sampling/importance_sampling_ratio/mean": 0.9813326060771942,
"sampling/importance_sampling_ratio/min": 0.1118293896317482,
"sampling/sampling_logp_difference/max": 1.1312953352928161,
"sampling/sampling_logp_difference/mean": 0.003896066313609481,
"step": 12810,
"step_time": 6.251067082109512
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1922.9,
"completions/max_terminated_length": 1261.6,
"completions/mean_length": 163.297265625,
"completions/mean_terminated_length": 153.70449600219726,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.04482683974783867,
"epoch": 27.451820128479657,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.095703125,
"learning_rate": 8.7181e-06,
"loss": -0.0026,
"num_tokens": 1269350267.0,
"reward": 1.0539453148841857,
"reward_std": 0.19547195360064507,
"rewards/reward_accuracy/mean": 0.954296875,
"rewards/reward_accuracy/std": 0.1933488205075264,
"rewards/reward_format/mean": 0.09964843764901161,
"rewards/reward_format/std": 0.004572975169867277,
"sampling/importance_sampling_ratio/max": 2.543981337547302,
"sampling/importance_sampling_ratio/mean": 0.9973530054092408,
"sampling/importance_sampling_ratio/min": 0.10848766937851906,
"sampling/sampling_logp_difference/max": 1.2333608865737915,
"sampling/sampling_logp_difference/mean": 0.004053532774560153,
"step": 12820,
"step_time": 8.956218868106953
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1171.0,
"completions/max_terminated_length": 1059.5,
"completions/mean_length": 160.027734375,
"completions/mean_terminated_length": 154.17039184570314,
"completions/min_length": 68.5,
"completions/min_terminated_length": 68.5,
"entropy": 0.04126852778717875,
"epoch": 27.47323340471092,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.4140625,
"learning_rate": 8.7171e-06,
"loss": -0.0042,
"num_tokens": 1270271490.0,
"reward": 1.0665429770946502,
"reward_std": 0.14162331819534302,
"rewards/reward_accuracy/mean": 0.966796875,
"rewards/reward_accuracy/std": 0.1407642848789692,
"rewards/reward_format/mean": 0.09974609389901161,
"rewards/reward_format/std": 0.0030259526334702968,
"sampling/importance_sampling_ratio/max": 2.4630632519721987,
"sampling/importance_sampling_ratio/mean": 0.9851805746555329,
"sampling/importance_sampling_ratio/min": 0.11835673600435256,
"sampling/sampling_logp_difference/max": 1.033133625984192,
"sampling/sampling_logp_difference/mean": 0.004085207590833306,
"step": 12830,
"step_time": 5.779428286699113
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1047.9,
"completions/max_terminated_length": 838.4,
"completions/mean_length": 143.458984375,
"completions/mean_terminated_length": 138.27017059326172,
"completions/min_length": 62.9,
"completions/min_terminated_length": 62.9,
"entropy": 0.03547010645270347,
"epoch": 27.494646680942186,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.716100000000001e-06,
"loss": -0.002,
"num_tokens": 1271154569.0,
"reward": 1.075585949420929,
"reward_std": 0.11997815147042275,
"rewards/reward_accuracy/mean": 0.97578125,
"rewards/reward_accuracy/std": 0.1188519462943077,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.00205810007173568,
"sampling/importance_sampling_ratio/max": 2.354155921936035,
"sampling/importance_sampling_ratio/mean": 0.9941743850708008,
"sampling/importance_sampling_ratio/min": 0.16513223927468063,
"sampling/sampling_logp_difference/max": 0.9113045036792755,
"sampling/sampling_logp_difference/mean": 0.003784834989346564,
"step": 12840,
"step_time": 5.143843644985464
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1154.8,
"completions/max_terminated_length": 897.6,
"completions/mean_length": 151.213671875,
"completions/mean_terminated_length": 141.65199127197266,
"completions/min_length": 62.1,
"completions/min_terminated_length": 62.1,
"entropy": 0.03573659360408783,
"epoch": 27.516059957173447,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.7151e-06,
"loss": -0.0027,
"num_tokens": 1272059996.0,
"reward": 1.0671875178813934,
"reward_std": 0.13072458207607268,
"rewards/reward_accuracy/mean": 0.967578125,
"rewards/reward_accuracy/std": 0.1288308709859848,
"rewards/reward_format/mean": 0.09960937649011611,
"rewards/reward_format/std": 0.0038280523382127284,
"sampling/importance_sampling_ratio/max": 2.468545126914978,
"sampling/importance_sampling_ratio/mean": 0.9904430270195007,
"sampling/importance_sampling_ratio/min": 0.19300438836216927,
"sampling/sampling_logp_difference/max": 1.027925395965576,
"sampling/sampling_logp_difference/mean": 0.0036386790685355662,
"step": 12850,
"step_time": 5.983752140504658
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1459.3,
"completions/max_terminated_length": 1099.1,
"completions/mean_length": 152.64453125,
"completions/mean_terminated_length": 149.6804977416992,
"completions/min_length": 60.7,
"completions/min_terminated_length": 60.7,
"entropy": 0.03858807133510709,
"epoch": 27.53747323340471,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.7141e-06,
"loss": -0.0042,
"num_tokens": 1272964894.0,
"reward": 1.0796093821525574,
"reward_std": 0.09766365140676499,
"rewards/reward_accuracy/mean": 0.9796875,
"rewards/reward_accuracy/std": 0.09718603640794754,
"rewards/reward_format/mean": 0.09992187544703483,
"rewards/reward_format/std": 0.0012500000651925803,
"sampling/importance_sampling_ratio/max": 2.38662052154541,
"sampling/importance_sampling_ratio/mean": 0.9819619953632355,
"sampling/importance_sampling_ratio/min": 0.09884328246116639,
"sampling/sampling_logp_difference/max": 0.8948911309242249,
"sampling/sampling_logp_difference/mean": 0.003828906361013651,
"step": 12860,
"step_time": 6.927028169485856
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1486.5,
"completions/max_terminated_length": 1332.7,
"completions/mean_length": 159.763671875,
"completions/mean_terminated_length": 154.61017303466798,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.04426037590019405,
"epoch": 27.558886509635975,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.15625,
"learning_rate": 8.713100000000001e-06,
"loss": -0.0045,
"num_tokens": 1273891409.0,
"reward": 1.0692578315734864,
"reward_std": 0.14084397703409196,
"rewards/reward_accuracy/mean": 0.96953125,
"rewards/reward_accuracy/std": 0.1391481101512909,
"rewards/reward_format/mean": 0.0997265636920929,
"rewards/reward_format/std": 0.003655523038469255,
"sampling/importance_sampling_ratio/max": 2.365788757801056,
"sampling/importance_sampling_ratio/mean": 0.98888099193573,
"sampling/importance_sampling_ratio/min": 0.06380282938480378,
"sampling/sampling_logp_difference/max": 1.058088195323944,
"sampling/sampling_logp_difference/mean": 0.00412999875843525,
"step": 12870,
"step_time": 7.139274032990215
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1397.1,
"completions/max_terminated_length": 1278.7,
"completions/mean_length": 162.419921875,
"completions/mean_terminated_length": 155.8061981201172,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.040362578933127224,
"epoch": 27.580299785867236,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.28515625,
"learning_rate": 8.7121e-06,
"loss": -0.0038,
"num_tokens": 1274827908.0,
"reward": 1.049863302707672,
"reward_std": 0.18408206701278687,
"rewards/reward_accuracy/mean": 0.95,
"rewards/reward_accuracy/std": 0.1831890694797039,
"rewards/reward_format/mean": 0.09986328259110451,
"rewards/reward_format/std": 0.0018196488032117485,
"sampling/importance_sampling_ratio/max": 2.4672887563705443,
"sampling/importance_sampling_ratio/mean": 0.986926144361496,
"sampling/importance_sampling_ratio/min": 0.11467427611351014,
"sampling/sampling_logp_difference/max": 0.9358158826828002,
"sampling/sampling_logp_difference/mean": 0.00407578619197011,
"step": 12880,
"step_time": 6.736001097195549
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1259.2,
"completions/max_terminated_length": 1177.8,
"completions/mean_length": 148.690625,
"completions/mean_terminated_length": 146.4906768798828,
"completions/min_length": 65.2,
"completions/min_terminated_length": 65.2,
"entropy": 0.03986632216256112,
"epoch": 27.6017130620985,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0810546875,
"learning_rate": 8.711100000000002e-06,
"loss": -0.0044,
"num_tokens": 1275720300.0,
"reward": 1.0690625190734864,
"reward_std": 0.12622449919581413,
"rewards/reward_accuracy/mean": 0.969140625,
"rewards/reward_accuracy/std": 0.12562571763992308,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.0012500001117587089,
"sampling/importance_sampling_ratio/max": 2.3979310035705566,
"sampling/importance_sampling_ratio/mean": 0.9910275340080261,
"sampling/importance_sampling_ratio/min": 0.09978687502443791,
"sampling/sampling_logp_difference/max": 0.8540083408355713,
"sampling/sampling_logp_difference/mean": 0.0038633770309388638,
"step": 12890,
"step_time": 6.161130088107893
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1492.9,
"completions/max_terminated_length": 1262.6,
"completions/mean_length": 170.398828125,
"completions/mean_terminated_length": 160.9187973022461,
"completions/min_length": 62.8,
"completions/min_terminated_length": 62.8,
"entropy": 0.0441057852236554,
"epoch": 27.623126338329765,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.1484375,
"learning_rate": 8.7101e-06,
"loss": -0.0089,
"num_tokens": 1276677305.0,
"reward": 1.0581250190734863,
"reward_std": 0.17828277498483658,
"rewards/reward_accuracy/mean": 0.95859375,
"rewards/reward_accuracy/std": 0.17597878351807594,
"rewards/reward_format/mean": 0.0995312511920929,
"rewards/reward_format/std": 0.004046314326114952,
"sampling/importance_sampling_ratio/max": 2.515130567550659,
"sampling/importance_sampling_ratio/mean": 0.9944221794605255,
"sampling/importance_sampling_ratio/min": 0.17301706969738007,
"sampling/sampling_logp_difference/max": 0.9775100469589233,
"sampling/sampling_logp_difference/mean": 0.004149215715005994,
"step": 12900,
"step_time": 7.2081859673082365
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1068.1,
"completions/max_terminated_length": 920.5,
"completions/mean_length": 152.630078125,
"completions/mean_terminated_length": 146.7806838989258,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.03842903433833271,
"epoch": 27.644539614561026,
"frac_reward_zero_std": 0.93125,
"grad_norm": 1.1953125,
"learning_rate": 8.709100000000001e-06,
"loss": 0.0012,
"num_tokens": 1277586518.0,
"reward": 1.0705273687839507,
"reward_std": 0.10538522452116013,
"rewards/reward_accuracy/mean": 0.970703125,
"rewards/reward_accuracy/std": 0.1043634757399559,
"rewards/reward_format/mean": 0.09982422068715095,
"rewards/reward_format/std": 0.00208563432097435,
"sampling/importance_sampling_ratio/max": 2.3018619894981383,
"sampling/importance_sampling_ratio/mean": 0.9831875443458558,
"sampling/importance_sampling_ratio/min": 0.15567876324057578,
"sampling/sampling_logp_difference/max": 1.025701916217804,
"sampling/sampling_logp_difference/mean": 0.0035845516016706825,
"step": 12910,
"step_time": 5.506761588499648
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 691.4,
"completions/max_terminated_length": 691.4,
"completions/mean_length": 139.575390625,
"completions/mean_terminated_length": 139.575390625,
"completions/min_length": 67.9,
"completions/min_terminated_length": 67.9,
"entropy": 0.03462006852496415,
"epoch": 27.66595289079229,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.2236328125,
"learning_rate": 8.7081e-06,
"loss": -0.0016,
"num_tokens": 1278460919.0,
"reward": 1.0871093988418579,
"reward_std": 0.0834203913807869,
"rewards/reward_accuracy/mean": 0.987109375,
"rewards/reward_accuracy/std": 0.08342039585113525,
"rewards/reward_format/mean": 0.10000000149011612,
"rewards/reward_format/std": 0.0,
"sampling/importance_sampling_ratio/max": 2.389651656150818,
"sampling/importance_sampling_ratio/mean": 0.9903437614440918,
"sampling/importance_sampling_ratio/min": 0.14704681038856507,
"sampling/sampling_logp_difference/max": 0.9873035073280334,
"sampling/sampling_logp_difference/mean": 0.0037934630643576385,
"step": 12920,
"step_time": 3.6354902309161843
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1358.4,
"completions/max_terminated_length": 1087.1,
"completions/mean_length": 151.61875,
"completions/mean_terminated_length": 147.93353118896485,
"completions/min_length": 68.8,
"completions/min_terminated_length": 68.8,
"entropy": 0.03966882138047367,
"epoch": 27.687366167023555,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.1298828125,
"learning_rate": 8.7071e-06,
"loss": -0.001,
"num_tokens": 1279371831.0,
"reward": 1.0771289348602295,
"reward_std": 0.12040040716528892,
"rewards/reward_accuracy/mean": 0.97734375,
"rewards/reward_accuracy/std": 0.11921647787094117,
"rewards/reward_format/mean": 0.09978515803813934,
"rewards/reward_format/std": 0.0023297667503356934,
"sampling/importance_sampling_ratio/max": 2.388772225379944,
"sampling/importance_sampling_ratio/mean": 0.9892407536506653,
"sampling/importance_sampling_ratio/min": 0.1412813164293766,
"sampling/sampling_logp_difference/max": 0.9797701597213745,
"sampling/sampling_logp_difference/mean": 0.003858886379748583,
"step": 12930,
"step_time": 6.495079586404609
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1203.6,
"completions/max_terminated_length": 979.9,
"completions/mean_length": 156.610546875,
"completions/mean_terminated_length": 150.78177337646486,
"completions/min_length": 62.1,
"completions/min_terminated_length": 62.1,
"entropy": 0.047826943430118264,
"epoch": 27.70877944325482,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.310546875,
"learning_rate": 8.706100000000001e-06,
"loss": -0.0037,
"num_tokens": 1280294834.0,
"reward": 1.0560156464576722,
"reward_std": 0.15666093230247496,
"rewards/reward_accuracy/mean": 0.95625,
"rewards/reward_accuracy/std": 0.15590065717697144,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0024903097189962866,
"sampling/importance_sampling_ratio/max": 2.4155816435813904,
"sampling/importance_sampling_ratio/mean": 0.9882307827472687,
"sampling/importance_sampling_ratio/min": 0.07385055869817733,
"sampling/sampling_logp_difference/max": 0.9412063896656037,
"sampling/sampling_logp_difference/mean": 0.004315629904158414,
"step": 12940,
"step_time": 6.064140359126031
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1154.9,
"completions/max_terminated_length": 836.5,
"completions/mean_length": 144.43828125,
"completions/mean_terminated_length": 140.74942779541016,
"completions/min_length": 60.8,
"completions/min_terminated_length": 60.8,
"entropy": 0.036141910799779,
"epoch": 27.73019271948608,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.31640625,
"learning_rate": 8.7051e-06,
"loss": -0.001,
"num_tokens": 1281180980.0,
"reward": 1.0720507979393006,
"reward_std": 0.1304897241294384,
"rewards/reward_accuracy/mean": 0.972265625,
"rewards/reward_accuracy/std": 0.12909154444932938,
"rewards/reward_format/mean": 0.09978515729308128,
"rewards/reward_format/std": 0.002410865551792085,
"sampling/importance_sampling_ratio/max": 2.470582830905914,
"sampling/importance_sampling_ratio/mean": 0.9940130710601807,
"sampling/importance_sampling_ratio/min": 0.22162851095199584,
"sampling/sampling_logp_difference/max": 1.0078018665313722,
"sampling/sampling_logp_difference/mean": 0.0036880628671497107,
"step": 12950,
"step_time": 5.67103615688975
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1203.8,
"completions/max_terminated_length": 1124.8,
"completions/mean_length": 165.593359375,
"completions/mean_terminated_length": 158.26859130859376,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"entropy": 0.04139455712866038,
"epoch": 27.751605995717345,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.6953125,
"learning_rate": 8.7041e-06,
"loss": 0.0015,
"num_tokens": 1282121379.0,
"reward": 1.0778711080551147,
"reward_std": 0.11258351504802704,
"rewards/reward_accuracy/mean": 0.978125,
"rewards/reward_accuracy/std": 0.11113853901624679,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.0027235510060563684,
"sampling/importance_sampling_ratio/max": 2.5468506693840025,
"sampling/importance_sampling_ratio/mean": 0.9942931890487671,
"sampling/importance_sampling_ratio/min": 0.09157894372474402,
"sampling/sampling_logp_difference/max": 1.1023525595664978,
"sampling/sampling_logp_difference/mean": 0.0038919676560908558,
"step": 12960,
"step_time": 5.90251281640667
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1417.5,
"completions/max_terminated_length": 1077.2,
"completions/mean_length": 160.714453125,
"completions/mean_terminated_length": 150.44672393798828,
"completions/min_length": 68.2,
"completions/min_terminated_length": 68.2,
"entropy": 0.04080183405894786,
"epoch": 27.77301927194861,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0791015625,
"learning_rate": 8.703100000000001e-06,
"loss": -0.0029,
"num_tokens": 1283054712.0,
"reward": 1.056640636920929,
"reward_std": 0.1652522638440132,
"rewards/reward_accuracy/mean": 0.95703125,
"rewards/reward_accuracy/std": 0.16279858201742173,
"rewards/reward_format/mean": 0.09960937574505806,
"rewards/reward_format/std": 0.004015847947448492,
"sampling/importance_sampling_ratio/max": 2.5608871221542358,
"sampling/importance_sampling_ratio/mean": 0.98423131108284,
"sampling/importance_sampling_ratio/min": 0.1098213056102395,
"sampling/sampling_logp_difference/max": 1.2456038355827332,
"sampling/sampling_logp_difference/mean": 0.004164350172504783,
"step": 12970,
"step_time": 6.904706092711422
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.2589281797991133e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.2589281797991133e-06,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1616.6,
"completions/max_terminated_length": 1245.4,
"completions/mean_length": 165.707421875,
"completions/mean_terminated_length": 147.1475456237793,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.0420915192225948,
"epoch": 27.79443254817987,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.702100000000001e-06,
"loss": -0.0081,
"num_tokens": 1283994987.0,
"reward": 1.0570898652076721,
"reward_std": 0.17122104912996292,
"rewards/reward_accuracy/mean": 0.9578125,
"rewards/reward_accuracy/std": 0.16771951243281363,
"rewards/reward_format/mean": 0.09927734583616257,
"rewards/reward_format/std": 0.005648614186793566,
"sampling/importance_sampling_ratio/max": 2.401214826107025,
"sampling/importance_sampling_ratio/mean": 0.985903549194336,
"sampling/importance_sampling_ratio/min": 0.04439444839954376,
"sampling/sampling_logp_difference/max": 0.8360164523124695,
"sampling/sampling_logp_difference/mean": 0.0037709024036303163,
"step": 12980,
"step_time": 7.752742811103235
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1328.9,
"completions/max_terminated_length": 800.8,
"completions/mean_length": 159.06796875,
"completions/mean_terminated_length": 150.95804824829102,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.039370284578762946,
"epoch": 27.815845824411134,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.08544921875,
"learning_rate": 8.7011e-06,
"loss": -0.0029,
"num_tokens": 1284928601.0,
"reward": 1.0793164372444153,
"reward_std": 0.10433221235871315,
"rewards/reward_accuracy/mean": 0.9796875,
"rewards/reward_accuracy/std": 0.10177754312753677,
"rewards/reward_format/mean": 0.09962890818715095,
"rewards/reward_format/std": 0.003485042788088322,
"sampling/importance_sampling_ratio/max": 2.54992299079895,
"sampling/importance_sampling_ratio/mean": 0.9875097393989563,
"sampling/importance_sampling_ratio/min": 0.09740905947983265,
"sampling/sampling_logp_difference/max": 1.0582430005073546,
"sampling/sampling_logp_difference/mean": 0.0039867309387773275,
"step": 12990,
"step_time": 6.424410207915935
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1194.0,
"completions/max_terminated_length": 995.7,
"completions/mean_length": 157.204296875,
"completions/mean_terminated_length": 152.1134246826172,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.04157782101538032,
"epoch": 27.8372591006424,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.408203125,
"learning_rate": 8.7001e-06,
"loss": -0.0073,
"num_tokens": 1285848708.0,
"reward": 1.054765647649765,
"reward_std": 0.176116418838501,
"rewards/reward_accuracy/mean": 0.955078125,
"rewards/reward_accuracy/std": 0.17470904514193536,
"rewards/reward_format/mean": 0.09968750104308129,
"rewards/reward_format/std": 0.003098572860471904,
"sampling/importance_sampling_ratio/max": 2.3740325212478637,
"sampling/importance_sampling_ratio/mean": 0.9838525414466858,
"sampling/importance_sampling_ratio/min": 0.10982273202389478,
"sampling/sampling_logp_difference/max": 0.9930864572525024,
"sampling/sampling_logp_difference/mean": 0.004033823870122433,
"step": 13000,
"step_time": 5.684522345502046
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1289.5,
"completions/max_terminated_length": 1239.2,
"completions/mean_length": 166.225,
"completions/mean_terminated_length": 156.67950744628905,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"entropy": 0.044304001005366446,
"epoch": 27.858672376873663,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.6953125,
"learning_rate": 8.699100000000001e-06,
"loss": 0.0002,
"num_tokens": 1286791716.0,
"reward": 1.0734375238418579,
"reward_std": 0.12147349119186401,
"rewards/reward_accuracy/mean": 0.973828125,
"rewards/reward_accuracy/std": 0.11982047855854035,
"rewards/reward_format/mean": 0.09960937574505806,
"rewards/reward_format/std": 0.003080030856654048,
"sampling/importance_sampling_ratio/max": 2.4854866743087767,
"sampling/importance_sampling_ratio/mean": 0.9860330581665039,
"sampling/importance_sampling_ratio/min": 0.17226167321205138,
"sampling/sampling_logp_difference/max": 0.9266397953033447,
"sampling/sampling_logp_difference/mean": 0.0039402395486831665,
"step": 13010,
"step_time": 6.680274589403416
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1529.0,
"completions/max_terminated_length": 1462.9,
"completions/mean_length": 174.7328125,
"completions/mean_terminated_length": 160.76648025512696,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.04863137691281736,
"epoch": 27.880085653104924,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.6981e-06,
"loss": -0.0061,
"num_tokens": 1287758584.0,
"reward": 1.0515039324760438,
"reward_std": 0.15669994726777076,
"rewards/reward_accuracy/mean": 0.951953125,
"rewards/reward_accuracy/std": 0.15451934486627578,
"rewards/reward_format/mean": 0.09955078288912773,
"rewards/reward_format/std": 0.004349798150360584,
"sampling/importance_sampling_ratio/max": 2.450083088874817,
"sampling/importance_sampling_ratio/mean": 0.9837409675121307,
"sampling/importance_sampling_ratio/min": 0.11391355842351913,
"sampling/sampling_logp_difference/max": 1.1849013030529023,
"sampling/sampling_logp_difference/mean": 0.004325952753424645,
"step": 13020,
"step_time": 7.6205776705173776
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1371.8,
"completions/max_terminated_length": 1310.0,
"completions/mean_length": 171.544921875,
"completions/mean_terminated_length": 156.70249938964844,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.04137302504386753,
"epoch": 27.90149892933619,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0595703125,
"learning_rate": 8.6971e-06,
"loss": -0.0035,
"num_tokens": 1288728283.0,
"reward": 1.060644555091858,
"reward_std": 0.17258162200450897,
"rewards/reward_accuracy/mean": 0.961328125,
"rewards/reward_accuracy/std": 0.16972539573907852,
"rewards/reward_format/mean": 0.09931640774011612,
"rewards/reward_format/std": 0.003884907253086567,
"sampling/importance_sampling_ratio/max": 2.511427903175354,
"sampling/importance_sampling_ratio/mean": 0.9861873745918274,
"sampling/importance_sampling_ratio/min": 0.0622662141919136,
"sampling/sampling_logp_difference/max": 1.130926650762558,
"sampling/sampling_logp_difference/mean": 0.004002170078456402,
"step": 13030,
"step_time": 6.947361674794228
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1595.6,
"completions/max_terminated_length": 1432.4,
"completions/mean_length": 159.8265625,
"completions/mean_terminated_length": 156.15553436279296,
"completions/min_length": 67.1,
"completions/min_terminated_length": 67.1,
"entropy": 0.04409140534698963,
"epoch": 27.922912205567453,
"frac_reward_zero_std": 0.86875,
"grad_norm": 0.53515625,
"learning_rate": 8.696100000000001e-06,
"loss": -0.0123,
"num_tokens": 1289652303.0,
"reward": 1.0599414110183716,
"reward_std": 0.16889599114656448,
"rewards/reward_accuracy/mean": 0.96015625,
"rewards/reward_accuracy/std": 0.16799963116645814,
"rewards/reward_format/mean": 0.09978515654802322,
"rewards/reward_format/std": 0.0030696488218382003,
"sampling/importance_sampling_ratio/max": 2.5394317865371705,
"sampling/importance_sampling_ratio/mean": 0.9819258153438568,
"sampling/importance_sampling_ratio/min": 0.050520863942801954,
"sampling/sampling_logp_difference/max": 1.310968816280365,
"sampling/sampling_logp_difference/mean": 0.00419839695096016,
"step": 13040,
"step_time": 7.61758183488273
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1238.3,
"completions/max_terminated_length": 1020.0,
"completions/mean_length": 145.40390625,
"completions/mean_terminated_length": 141.7096939086914,
"completions/min_length": 63.1,
"completions/min_terminated_length": 63.1,
"entropy": 0.041063860338181254,
"epoch": 27.944325481798714,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.53515625,
"learning_rate": 8.6951e-06,
"loss": -0.0032,
"num_tokens": 1290534825.0,
"reward": 1.0830078363418578,
"reward_std": 0.08934693187475204,
"rewards/reward_accuracy/mean": 0.983203125,
"rewards/reward_accuracy/std": 0.0881997987627983,
"rewards/reward_format/mean": 0.09980468899011612,
"rewards/reward_format/std": 0.002398134325630963,
"sampling/importance_sampling_ratio/max": 2.3657471895217896,
"sampling/importance_sampling_ratio/mean": 0.9812738597393036,
"sampling/importance_sampling_ratio/min": 0.1101413231343031,
"sampling/sampling_logp_difference/max": 0.969576609134674,
"sampling/sampling_logp_difference/mean": 0.00396260148845613,
"step": 13050,
"step_time": 6.075851808005245
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1367.5,
"completions/max_terminated_length": 992.1,
"completions/mean_length": 147.587890625,
"completions/mean_terminated_length": 140.1568618774414,
"completions/min_length": 61.0,
"completions/min_terminated_length": 61.0,
"entropy": 0.04172294177114964,
"epoch": 27.96573875802998,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.7578125,
"learning_rate": 8.6941e-06,
"loss": -0.0041,
"num_tokens": 1291432938.0,
"reward": 1.062871116399765,
"reward_std": 0.13347192630171775,
"rewards/reward_accuracy/mean": 0.96328125,
"rewards/reward_accuracy/std": 0.13203653544187546,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.004202844342216849,
"sampling/importance_sampling_ratio/max": 2.2988307952880858,
"sampling/importance_sampling_ratio/mean": 0.9917350828647613,
"sampling/importance_sampling_ratio/min": 0.1323698103427887,
"sampling/sampling_logp_difference/max": 0.8860871493816376,
"sampling/sampling_logp_difference/mean": 0.004202518961392343,
"step": 13060,
"step_time": 6.563918544910848
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1356.0,
"completions/max_terminated_length": 968.3,
"completions/mean_length": 156.505859375,
"completions/mean_terminated_length": 149.10959091186524,
"completions/min_length": 62.2,
"completions/min_terminated_length": 62.2,
"entropy": 0.0347032772609964,
"epoch": 27.987152034261243,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.734375,
"learning_rate": 8.693100000000002e-06,
"loss": -0.0052,
"num_tokens": 1292351497.0,
"reward": 1.0634570300579071,
"reward_std": 0.16018104031682015,
"rewards/reward_accuracy/mean": 0.963671875,
"rewards/reward_accuracy/std": 0.15924937427043914,
"rewards/reward_format/mean": 0.09978515580296517,
"rewards/reward_format/std": 0.002545661083422601,
"sampling/importance_sampling_ratio/max": 2.4761953234672545,
"sampling/importance_sampling_ratio/mean": 0.9931523084640503,
"sampling/importance_sampling_ratio/min": 0.13602372258901596,
"sampling/sampling_logp_difference/max": 1.0491658091545104,
"sampling/sampling_logp_difference/mean": 0.003629885381087661,
"step": 13070,
"step_time": 6.468491938806255
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1426.5,
"completions/max_terminated_length": 914.8,
"completions/mean_length": 164.51328125,
"completions/mean_terminated_length": 151.29577178955077,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.040872831176966426,
"epoch": 28.008565310492504,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.1328125,
"learning_rate": 8.692100000000001e-06,
"loss": -0.0051,
"num_tokens": 1293289915.0,
"reward": 1.0655078411102294,
"reward_std": 0.15703522115945817,
"rewards/reward_accuracy/mean": 0.966015625,
"rewards/reward_accuracy/std": 0.15401292443275452,
"rewards/reward_format/mean": 0.09949218928813934,
"rewards/reward_format/std": 0.0044851107755675915,
"sampling/importance_sampling_ratio/max": 2.339126193523407,
"sampling/importance_sampling_ratio/mean": 0.9877094924449921,
"sampling/importance_sampling_ratio/min": 0.09851740449666976,
"sampling/sampling_logp_difference/max": 1.050800633430481,
"sampling/sampling_logp_difference/mean": 0.003826240380294621,
"step": 13080,
"step_time": 7.085253784587257
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1365.4,
"completions/max_terminated_length": 954.2,
"completions/mean_length": 159.068359375,
"completions/mean_terminated_length": 148.0522003173828,
"completions/min_length": 61.6,
"completions/min_terminated_length": 61.6,
"entropy": 0.04005875908769667,
"epoch": 28.029978586723768,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.6911e-06,
"loss": -0.0042,
"num_tokens": 1294221050.0,
"reward": 1.052734386920929,
"reward_std": 0.20051467567682266,
"rewards/reward_accuracy/mean": 0.953125,
"rewards/reward_accuracy/std": 0.1982578307390213,
"rewards/reward_format/mean": 0.09960937574505806,
"rewards/reward_format/std": 0.004114329349249601,
"sampling/importance_sampling_ratio/max": 2.285173785686493,
"sampling/importance_sampling_ratio/mean": 0.9792404651641846,
"sampling/importance_sampling_ratio/min": 0.1036287598311901,
"sampling/sampling_logp_difference/max": 1.2234504878520966,
"sampling/sampling_logp_difference/mean": 0.003838155069388449,
"step": 13090,
"step_time": 6.578756675808108
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 960.7,
"completions/max_terminated_length": 841.4,
"completions/mean_length": 147.748046875,
"completions/mean_terminated_length": 144.79315795898438,
"completions/min_length": 60.5,
"completions/min_terminated_length": 60.5,
"entropy": 0.03343406671192497,
"epoch": 28.051391862955033,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.40625,
"learning_rate": 8.6901e-06,
"loss": -0.0041,
"num_tokens": 1295120229.0,
"reward": 1.0725390911102295,
"reward_std": 0.11561534702777862,
"rewards/reward_accuracy/mean": 0.97265625,
"rewards/reward_accuracy/std": 0.11468309089541436,
"rewards/reward_format/mean": 0.09988281428813935,
"rewards/reward_format/std": 0.001395348599180579,
"sampling/importance_sampling_ratio/max": 2.3816556096076966,
"sampling/importance_sampling_ratio/mean": 0.9841433584690094,
"sampling/importance_sampling_ratio/min": 0.09289405047893524,
"sampling/sampling_logp_difference/max": 1.033457136154175,
"sampling/sampling_logp_difference/mean": 0.003625553590245545,
"step": 13100,
"step_time": 4.927355523096049
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1395.9,
"completions/max_terminated_length": 1285.8,
"completions/mean_length": 168.685546875,
"completions/mean_terminated_length": 156.30270690917968,
"completions/min_length": 63.7,
"completions/min_terminated_length": 63.7,
"entropy": 0.045071494113653895,
"epoch": 28.072805139186297,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.23828125,
"learning_rate": 8.6891e-06,
"loss": -0.0049,
"num_tokens": 1296068672.0,
"reward": 1.0767382860183716,
"reward_std": 0.11382238492369652,
"rewards/reward_accuracy/mean": 0.97734375,
"rewards/reward_accuracy/std": 0.11175906211137772,
"rewards/reward_format/mean": 0.09939453154802322,
"rewards/reward_format/std": 0.004075078875757754,
"sampling/importance_sampling_ratio/max": 2.4182161569595335,
"sampling/importance_sampling_ratio/mean": 0.9855726599693299,
"sampling/importance_sampling_ratio/min": 0.08099140338599682,
"sampling/sampling_logp_difference/max": 0.9449471712112427,
"sampling/sampling_logp_difference/mean": 0.004078069305978716,
"step": 13110,
"step_time": 6.8982612537889505
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1587.9,
"completions/max_terminated_length": 1227.8,
"completions/mean_length": 155.21484375,
"completions/mean_terminated_length": 147.11439514160156,
"completions/min_length": 60.6,
"completions/min_terminated_length": 60.6,
"entropy": 0.04204842522740364,
"epoch": 28.094218415417558,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.205078125,
"learning_rate": 8.6881e-06,
"loss": -0.0014,
"num_tokens": 1296982150.0,
"reward": 1.078515648841858,
"reward_std": 0.11887594163417817,
"rewards/reward_accuracy/mean": 0.97890625,
"rewards/reward_accuracy/std": 0.11630061790347099,
"rewards/reward_format/mean": 0.09960937649011611,
"rewards/reward_format/std": 0.0042156175477430224,
"sampling/importance_sampling_ratio/max": 2.474896454811096,
"sampling/importance_sampling_ratio/mean": 0.988919997215271,
"sampling/importance_sampling_ratio/min": 0.11022526361048221,
"sampling/sampling_logp_difference/max": 1.1501720666885376,
"sampling/sampling_logp_difference/mean": 0.003963170619681477,
"step": 13120,
"step_time": 7.543619872012641
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1354.1,
"completions/max_terminated_length": 1145.8,
"completions/mean_length": 154.48125,
"completions/mean_terminated_length": 145.71922912597657,
"completions/min_length": 69.7,
"completions/min_terminated_length": 69.7,
"entropy": 0.037356184679083526,
"epoch": 28.115631691648822,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.6871e-06,
"loss": -0.0047,
"num_tokens": 1297901030.0,
"reward": 1.0539453268051147,
"reward_std": 0.15052537769079208,
"rewards/reward_accuracy/mean": 0.954296875,
"rewards/reward_accuracy/std": 0.1492033287882805,
"rewards/reward_format/mean": 0.09964843839406967,
"rewards/reward_format/std": 0.0032621520571410657,
"sampling/importance_sampling_ratio/max": 2.3893508672714234,
"sampling/importance_sampling_ratio/mean": 0.9848679840564728,
"sampling/importance_sampling_ratio/min": 0.17922019809484482,
"sampling/sampling_logp_difference/max": 0.9682132005691528,
"sampling/sampling_logp_difference/mean": 0.0037002493860200047,
"step": 13130,
"step_time": 6.589438192118541
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1121.2,
"completions/max_terminated_length": 1061.4,
"completions/mean_length": 166.77578125,
"completions/mean_terminated_length": 154.3911575317383,
"completions/min_length": 63.5,
"completions/min_terminated_length": 63.5,
"entropy": 0.04224056063685566,
"epoch": 28.137044967880087,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.20703125,
"learning_rate": 8.686100000000001e-06,
"loss": -0.0029,
"num_tokens": 1298842456.0,
"reward": 1.047441416978836,
"reward_std": 0.19771077781915664,
"rewards/reward_accuracy/mean": 0.948046875,
"rewards/reward_accuracy/std": 0.19566955044865608,
"rewards/reward_format/mean": 0.09939453154802322,
"rewards/reward_format/std": 0.004069690825417638,
"sampling/importance_sampling_ratio/max": 2.4345272064208983,
"sampling/importance_sampling_ratio/mean": 0.9866859078407287,
"sampling/importance_sampling_ratio/min": 0.1817621173337102,
"sampling/sampling_logp_difference/max": 0.8996259570121765,
"sampling/sampling_logp_difference/mean": 0.0037364744348451495,
"step": 13140,
"step_time": 5.7847677013051
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1241.3,
"completions/max_terminated_length": 1038.6,
"completions/mean_length": 155.73828125,
"completions/mean_terminated_length": 143.78388061523438,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.03774581342004239,
"epoch": 28.158458244111348,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.685100000000001e-06,
"loss": -0.0012,
"num_tokens": 1299759434.0,
"reward": 1.0788281440734864,
"reward_std": 0.11014433577656746,
"rewards/reward_accuracy/mean": 0.979296875,
"rewards/reward_accuracy/std": 0.10833183377981186,
"rewards/reward_format/mean": 0.0995312511920929,
"rewards/reward_format/std": 0.002364127826876938,
"sampling/importance_sampling_ratio/max": 2.3637945890426635,
"sampling/importance_sampling_ratio/mean": 0.9910788893699646,
"sampling/importance_sampling_ratio/min": 0.14918339140713216,
"sampling/sampling_logp_difference/max": 0.9509690403938293,
"sampling/sampling_logp_difference/mean": 0.003791692922823131,
"step": 13150,
"step_time": 6.128373180495691
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 1268.2,
"completions/max_terminated_length": 1137.0,
"completions/mean_length": 147.04296875,
"completions/mean_terminated_length": 146.29796447753907,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.0365668342448771,
"epoch": 28.179871520342612,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0,
"learning_rate": 8.6841e-06,
"loss": -0.0052,
"num_tokens": 1300650072.0,
"reward": 1.081152367591858,
"reward_std": 0.0999692864716053,
"rewards/reward_accuracy/mean": 0.98125,
"rewards/reward_accuracy/std": 0.09953442513942719,
"rewards/reward_format/mean": 0.09990234524011612,
"rewards/reward_format/std": 0.0009338126750662923,
"sampling/importance_sampling_ratio/max": 2.5430352687835693,
"sampling/importance_sampling_ratio/mean": 0.9977124691009521,
"sampling/importance_sampling_ratio/min": 0.14858595253899692,
"sampling/sampling_logp_difference/max": 0.9521323800086975,
"sampling/sampling_logp_difference/mean": 0.003788057342171669,
"step": 13160,
"step_time": 6.002635276090587
},
{
"clip_ratio/high_max": 2.12856539292261e-05,
"clip_ratio/high_mean": 2.6607067411532626e-06,
"clip_ratio/low_mean": 9.426780616195174e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.2087487357348437e-05,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 798.1,
"completions/max_terminated_length": 785.9,
"completions/mean_length": 157.475,
"completions/mean_terminated_length": 141.15987701416014,
"completions/min_length": 66.3,
"completions/min_terminated_length": 66.3,
"entropy": 0.03957183929160237,
"epoch": 28.201284796573876,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.1572265625,
"learning_rate": 8.683100000000002e-06,
"loss": -0.0036,
"num_tokens": 1301571944.0,
"reward": 1.0826367378234862,
"reward_std": 0.08205190822482109,
"rewards/reward_accuracy/mean": 0.983203125,
"rewards/reward_accuracy/std": 0.08001433834433555,
"rewards/reward_format/mean": 0.09943359494209289,
"rewards/reward_format/std": 0.003123376052826643,
"sampling/importance_sampling_ratio/max": 2.5123523235321046,
"sampling/importance_sampling_ratio/mean": 0.9886368811130524,
"sampling/importance_sampling_ratio/min": 0.12415965124964715,
"sampling/sampling_logp_difference/max": 1.1202200949192047,
"sampling/sampling_logp_difference/mean": 0.0036936955293640494,
"step": 13170,
"step_time": 4.578537934401538
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1186.7,
"completions/max_terminated_length": 1138.2,
"completions/mean_length": 154.834765625,
"completions/mean_terminated_length": 148.98252716064454,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.039190560858696696,
"epoch": 28.22269807280514,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.26953125,
"learning_rate": 8.682100000000001e-06,
"loss": -0.0057,
"num_tokens": 1302490513.0,
"reward": 1.0653711080551147,
"reward_std": 0.1409989081323147,
"rewards/reward_accuracy/mean": 0.965625,
"rewards/reward_accuracy/std": 0.1397644691169262,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.002528924075886607,
"sampling/importance_sampling_ratio/max": 2.477232563495636,
"sampling/importance_sampling_ratio/mean": 0.9955600380897522,
"sampling/importance_sampling_ratio/min": 0.09745872393250465,
"sampling/sampling_logp_difference/max": 1.1382517695426941,
"sampling/sampling_logp_difference/mean": 0.0037554631009697912,
"step": 13180,
"step_time": 5.966435531689785
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 987.7,
"completions/max_terminated_length": 796.3,
"completions/mean_length": 151.510546875,
"completions/mean_terminated_length": 147.84449462890626,
"completions/min_length": 67.3,
"completions/min_terminated_length": 67.3,
"entropy": 0.036700312583707276,
"epoch": 28.2441113490364,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.091796875,
"learning_rate": 8.6811e-06,
"loss": -0.0048,
"num_tokens": 1303401788.0,
"reward": 1.0717773675918578,
"reward_std": 0.1347835525870323,
"rewards/reward_accuracy/mean": 0.971875,
"rewards/reward_accuracy/std": 0.1342431388795376,
"rewards/reward_format/mean": 0.09990234524011612,
"rewards/reward_format/std": 0.0011641392018646001,
"sampling/importance_sampling_ratio/max": 2.368663477897644,
"sampling/importance_sampling_ratio/mean": 0.9919331789016723,
"sampling/importance_sampling_ratio/min": 0.1539143890142441,
"sampling/sampling_logp_difference/max": 1.1675331234931945,
"sampling/sampling_logp_difference/mean": 0.003688230714760721,
"step": 13190,
"step_time": 5.004616538085974
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 981.8,
"completions/max_terminated_length": 788.6,
"completions/mean_length": 148.429296875,
"completions/mean_terminated_length": 143.3167282104492,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.040079256519675255,
"epoch": 28.265524625267666,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.6801e-06,
"loss": -0.0099,
"num_tokens": 1304298775.0,
"reward": 1.0877734661102294,
"reward_std": 0.06931608840823174,
"rewards/reward_accuracy/mean": 0.987890625,
"rewards/reward_accuracy/std": 0.0687858521938324,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.0012040342204272746,
"sampling/importance_sampling_ratio/max": 2.6376989841461183,
"sampling/importance_sampling_ratio/mean": 0.9868534624576568,
"sampling/importance_sampling_ratio/min": 0.1636597231030464,
"sampling/sampling_logp_difference/max": 0.9766019821166992,
"sampling/sampling_logp_difference/mean": 0.003914097999222576,
"step": 13200,
"step_time": 5.020963629803736
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 644.0,
"completions/max_terminated_length": 644.0,
"completions/mean_length": 134.474609375,
"completions/mean_terminated_length": 134.474609375,
"completions/min_length": 62.1,
"completions/min_terminated_length": 62.1,
"entropy": 0.029775189398787916,
"epoch": 28.28693790149893,
"frac_reward_zero_std": 0.9875,
"grad_norm": 0.0,
"learning_rate": 8.6791e-06,
"loss": 0.0002,
"num_tokens": 1305160294.0,
"reward": 1.079687523841858,
"reward_std": 0.08294598683714867,
"rewards/reward_accuracy/mean": 0.9796875,
"rewards/reward_accuracy/std": 0.08294599279761314,
"rewards/reward_format/mean": 0.10000000149011612,
"rewards/reward_format/std": 0.0,
"sampling/importance_sampling_ratio/max": 2.256991815567017,
"sampling/importance_sampling_ratio/mean": 0.9982369601726532,
"sampling/importance_sampling_ratio/min": 0.28383579552173616,
"sampling/sampling_logp_difference/max": 0.9041154384613037,
"sampling/sampling_logp_difference/mean": 0.003383147087879479,
"step": 13210,
"step_time": 3.381884812109638
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 5.9106909475303835e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 5.9106909475303835e-06,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 891.3,
"completions/max_terminated_length": 691.9,
"completions/mean_length": 157.075,
"completions/mean_terminated_length": 143.1296173095703,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.039024024782702324,
"epoch": 28.30835117773019,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.404296875,
"learning_rate": 8.6781e-06,
"loss": -0.0028,
"num_tokens": 1306080886.0,
"reward": 1.0567187666893005,
"reward_std": 0.15957941189408303,
"rewards/reward_accuracy/mean": 0.957421875,
"rewards/reward_accuracy/std": 0.1573205791413784,
"rewards/reward_format/mean": 0.09929687678813934,
"rewards/reward_format/std": 0.0035999549785628916,
"sampling/importance_sampling_ratio/max": 2.4541730999946596,
"sampling/importance_sampling_ratio/mean": 0.9881868362426758,
"sampling/importance_sampling_ratio/min": 0.15834179036319257,
"sampling/sampling_logp_difference/max": 1.1001577734947205,
"sampling/sampling_logp_difference/mean": 0.0038982074707746505,
"step": 13220,
"step_time": 4.754230588299106
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1044.3,
"completions/max_terminated_length": 953.6,
"completions/mean_length": 141.870703125,
"completions/mean_terminated_length": 138.91278076171875,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.03684261301532388,
"epoch": 28.329764453961456,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.359375,
"learning_rate": 8.6771e-06,
"loss": -0.0031,
"num_tokens": 1306957739.0,
"reward": 1.0620117425918578,
"reward_std": 0.12674197629094125,
"rewards/reward_accuracy/mean": 0.962109375,
"rewards/reward_accuracy/std": 0.12642287835478783,
"rewards/reward_format/mean": 0.09990234449505805,
"rewards/reward_format/std": 0.001562500116415322,
"sampling/importance_sampling_ratio/max": 2.440330219268799,
"sampling/importance_sampling_ratio/mean": 0.9994155526161194,
"sampling/importance_sampling_ratio/min": 0.08345298804342746,
"sampling/sampling_logp_difference/max": 1.190379399061203,
"sampling/sampling_logp_difference/mean": 0.003926268615759909,
"step": 13230,
"step_time": 5.0638667971041285
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1398.4,
"completions/max_terminated_length": 1049.1,
"completions/mean_length": 154.3765625,
"completions/mean_terminated_length": 149.1631004333496,
"completions/min_length": 66.4,
"completions/min_terminated_length": 66.4,
"entropy": 0.039886864949949086,
"epoch": 28.35117773019272,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.361328125,
"learning_rate": 8.6761e-06,
"loss": -0.0044,
"num_tokens": 1307870143.0,
"reward": 1.064628928899765,
"reward_std": 0.1517029359936714,
"rewards/reward_accuracy/mean": 0.96484375,
"rewards/reward_accuracy/std": 0.1509046271443367,
"rewards/reward_format/mean": 0.09978515803813934,
"rewards/reward_format/std": 0.00258260874543339,
"sampling/importance_sampling_ratio/max": 2.57426381111145,
"sampling/importance_sampling_ratio/mean": 0.9988402605056763,
"sampling/importance_sampling_ratio/min": 0.16199791841208935,
"sampling/sampling_logp_difference/max": 0.8822623252868652,
"sampling/sampling_logp_difference/mean": 0.003927463339641691,
"step": 13240,
"step_time": 6.629899485898204
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 951.9,
"completions/max_terminated_length": 875.9,
"completions/mean_length": 152.73203125,
"completions/mean_terminated_length": 148.42599487304688,
"completions/min_length": 67.7,
"completions/min_terminated_length": 67.7,
"entropy": 0.037383620347827676,
"epoch": 28.37259100642398,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.388671875,
"learning_rate": 8.675100000000001e-06,
"loss": -0.0078,
"num_tokens": 1308781521.0,
"reward": 1.071660178899765,
"reward_std": 0.11499057710170746,
"rewards/reward_accuracy/mean": 0.971875,
"rewards/reward_accuracy/std": 0.11388269290328026,
"rewards/reward_format/mean": 0.09978515729308128,
"rewards/reward_format/std": 0.0024009525775909426,
"sampling/importance_sampling_ratio/max": 2.464556932449341,
"sampling/importance_sampling_ratio/mean": 0.9851748168468475,
"sampling/importance_sampling_ratio/min": 0.10715697854757308,
"sampling/sampling_logp_difference/max": 0.9896301746368408,
"sampling/sampling_logp_difference/mean": 0.00381640309933573,
"step": 13250,
"step_time": 4.931158381298883
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1003.1,
"completions/max_terminated_length": 880.5,
"completions/mean_length": 141.0484375,
"completions/mean_terminated_length": 138.82608642578126,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.034027334023267033,
"epoch": 28.394004282655246,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.48046875,
"learning_rate": 8.6741e-06,
"loss": -0.0016,
"num_tokens": 1309652941.0,
"reward": 1.0831250309944154,
"reward_std": 0.09936796426773072,
"rewards/reward_accuracy/mean": 0.983203125,
"rewards/reward_accuracy/std": 0.09879705011844635,
"rewards/reward_format/mean": 0.09992187693715096,
"rewards/reward_format/std": 0.0008821486495435238,
"sampling/importance_sampling_ratio/max": 2.35096914768219,
"sampling/importance_sampling_ratio/mean": 0.9999150633811951,
"sampling/importance_sampling_ratio/min": 0.2144268261268735,
"sampling/sampling_logp_difference/max": 0.9508111834526062,
"sampling/sampling_logp_difference/mean": 0.0035654126666486265,
"step": 13260,
"step_time": 4.910030857496895
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1296.4,
"completions/max_terminated_length": 1192.4,
"completions/mean_length": 159.003125,
"completions/mean_terminated_length": 146.5129150390625,
"completions/min_length": 63.5,
"completions/min_terminated_length": 63.5,
"entropy": 0.03833015677519143,
"epoch": 28.41541755888651,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.673100000000002e-06,
"loss": -0.0077,
"num_tokens": 1310574613.0,
"reward": 1.0565234422683716,
"reward_std": 0.16720762923359872,
"rewards/reward_accuracy/mean": 0.95703125,
"rewards/reward_accuracy/std": 0.16518926247954369,
"rewards/reward_format/mean": 0.09949218779802323,
"rewards/reward_format/std": 0.0038014347897842526,
"sampling/importance_sampling_ratio/max": 2.446727991104126,
"sampling/importance_sampling_ratio/mean": 0.9874198257923126,
"sampling/importance_sampling_ratio/min": 0.12725390046834945,
"sampling/sampling_logp_difference/max": 0.9734459638595581,
"sampling/sampling_logp_difference/mean": 0.003915201989002526,
"step": 13270,
"step_time": 6.679052775111631
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1117.9,
"completions/max_terminated_length": 728.2,
"completions/mean_length": 143.390234375,
"completions/mean_terminated_length": 138.92577209472657,
"completions/min_length": 64.7,
"completions/min_terminated_length": 64.7,
"entropy": 0.035419428278692065,
"epoch": 28.436830835117775,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0,
"learning_rate": 8.672100000000001e-06,
"loss": -0.0063,
"num_tokens": 1311455004.0,
"reward": 1.080332052707672,
"reward_std": 0.10194839984178543,
"rewards/reward_accuracy/mean": 0.98046875,
"rewards/reward_accuracy/std": 0.10071304962038993,
"rewards/reward_format/mean": 0.09986328259110451,
"rewards/reward_format/std": 0.0017891392577439546,
"sampling/importance_sampling_ratio/max": 2.5102380990982054,
"sampling/importance_sampling_ratio/mean": 0.9902099251747132,
"sampling/importance_sampling_ratio/min": 0.10716822855174542,
"sampling/sampling_logp_difference/max": 0.9401945829391479,
"sampling/sampling_logp_difference/mean": 0.0037712538614869118,
"step": 13280,
"step_time": 5.463537433417514
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1279.8,
"completions/max_terminated_length": 990.2,
"completions/mean_length": 168.272265625,
"completions/mean_terminated_length": 156.62783508300782,
"completions/min_length": 67.4,
"completions/min_terminated_length": 67.4,
"entropy": 0.04031190925743431,
"epoch": 28.458244111349035,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.6711e-06,
"loss": -0.0025,
"num_tokens": 1312404149.0,
"reward": 1.062011754512787,
"reward_std": 0.14760885238647461,
"rewards/reward_accuracy/mean": 0.9625,
"rewards/reward_accuracy/std": 0.14543348997831346,
"rewards/reward_format/mean": 0.09951172024011612,
"rewards/reward_format/std": 0.004282740037888288,
"sampling/importance_sampling_ratio/max": 2.3663593530654907,
"sampling/importance_sampling_ratio/mean": 0.9935288310050965,
"sampling/importance_sampling_ratio/min": 0.1373595990240574,
"sampling/sampling_logp_difference/max": 0.9840340256690979,
"sampling/sampling_logp_difference/mean": 0.003845824277959764,
"step": 13290,
"step_time": 6.428619346107007
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 940.6,
"completions/max_terminated_length": 585.2,
"completions/mean_length": 134.323828125,
"completions/mean_terminated_length": 132.82625885009764,
"completions/min_length": 63.2,
"completions/min_terminated_length": 63.2,
"entropy": 0.03025934856850654,
"epoch": 28.4796573875803,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.0,
"learning_rate": 8.6701e-06,
"loss": -0.0047,
"num_tokens": 1313262930.0,
"reward": 1.0858984589576721,
"reward_std": 0.08161140605807304,
"rewards/reward_accuracy/mean": 0.9859375,
"rewards/reward_accuracy/std": 0.08115975707769393,
"rewards/reward_format/mean": 0.0999609388411045,
"rewards/reward_format/std": 0.0006250000558793544,
"sampling/importance_sampling_ratio/max": 2.3458269357681276,
"sampling/importance_sampling_ratio/mean": 0.9951291561126709,
"sampling/importance_sampling_ratio/min": 0.20336373150348663,
"sampling/sampling_logp_difference/max": 0.9372460246086121,
"sampling/sampling_logp_difference/mean": 0.003423348511569202,
"step": 13300,
"step_time": 4.701388344811858
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 783.3,
"completions/max_terminated_length": 740.8,
"completions/mean_length": 150.21328125,
"completions/mean_terminated_length": 145.11900177001954,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"entropy": 0.03447058578021824,
"epoch": 28.501070663811564,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.0,
"learning_rate": 8.6691e-06,
"loss": -0.0014,
"num_tokens": 1314167668.0,
"reward": 1.0755664348602294,
"reward_std": 0.10431410223245621,
"rewards/reward_accuracy/mean": 0.97578125,
"rewards/reward_accuracy/std": 0.10338561162352562,
"rewards/reward_format/mean": 0.09978515803813934,
"rewards/reward_format/std": 0.0019402996171265841,
"sampling/importance_sampling_ratio/max": 2.389009928703308,
"sampling/importance_sampling_ratio/mean": 0.991859358549118,
"sampling/importance_sampling_ratio/min": 0.16579312994144857,
"sampling/sampling_logp_difference/max": 0.8082674980163574,
"sampling/sampling_logp_difference/mean": 0.0036613501142710447,
"step": 13310,
"step_time": 4.225108503914089
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1233.2,
"completions/max_terminated_length": 1027.2,
"completions/mean_length": 151.4984375,
"completions/mean_terminated_length": 147.8886947631836,
"completions/min_length": 63.9,
"completions/min_terminated_length": 63.9,
"entropy": 0.03912614146247506,
"epoch": 28.522483940042825,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.668100000000001e-06,
"loss": -0.0055,
"num_tokens": 1315074144.0,
"reward": 1.0697070360183716,
"reward_std": 0.1212303213775158,
"rewards/reward_accuracy/mean": 0.969921875,
"rewards/reward_accuracy/std": 0.1200523965060711,
"rewards/reward_format/mean": 0.09978515654802322,
"rewards/reward_format/std": 0.0024568526772782207,
"sampling/importance_sampling_ratio/max": 2.627813529968262,
"sampling/importance_sampling_ratio/mean": 1.0060109674930573,
"sampling/importance_sampling_ratio/min": 0.1959863193333149,
"sampling/sampling_logp_difference/max": 0.9128129363059998,
"sampling/sampling_logp_difference/mean": 0.0040327091701328754,
"step": 13320,
"step_time": 5.820440816110931
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1230.0,
"completions/max_terminated_length": 986.0,
"completions/mean_length": 152.201953125,
"completions/mean_terminated_length": 148.5635787963867,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.037868288927711546,
"epoch": 28.54389721627409,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.357421875,
"learning_rate": 8.6671e-06,
"loss": 0.0047,
"num_tokens": 1315982053.0,
"reward": 1.075683605670929,
"reward_std": 0.12033465951681137,
"rewards/reward_accuracy/mean": 0.97578125,
"rewards/reward_accuracy/std": 0.11988399028778077,
"rewards/reward_format/mean": 0.09990234449505805,
"rewards/reward_format/std": 0.0013226743321865797,
"sampling/importance_sampling_ratio/max": 2.37308064699173,
"sampling/importance_sampling_ratio/mean": 0.9958141028881073,
"sampling/importance_sampling_ratio/min": 0.1331418737769127,
"sampling/sampling_logp_difference/max": 0.9927969813346863,
"sampling/sampling_logp_difference/mean": 0.0038069526432082056,
"step": 13330,
"step_time": 6.217719292204128
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1633.8,
"completions/max_terminated_length": 1306.4,
"completions/mean_length": 158.4609375,
"completions/mean_terminated_length": 154.0292999267578,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.039899183972738686,
"epoch": 28.565310492505354,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.341796875,
"learning_rate": 8.6661e-06,
"loss": -0.0052,
"num_tokens": 1316908721.0,
"reward": 1.0697656393051147,
"reward_std": 0.14395514577627183,
"rewards/reward_accuracy/mean": 0.969921875,
"rewards/reward_accuracy/std": 0.14311813190579414,
"rewards/reward_format/mean": 0.09984375089406967,
"rewards/reward_format/std": 0.002316074492409825,
"sampling/importance_sampling_ratio/max": 2.4327999353408813,
"sampling/importance_sampling_ratio/mean": 0.9842562079429626,
"sampling/importance_sampling_ratio/min": 0.08977850526571274,
"sampling/sampling_logp_difference/max": 1.1761682391166688,
"sampling/sampling_logp_difference/mean": 0.004057513596490025,
"step": 13340,
"step_time": 7.568273578002118
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1366.2,
"completions/max_terminated_length": 1291.5,
"completions/mean_length": 170.71640625,
"completions/mean_terminated_length": 156.89545440673828,
"completions/min_length": 67.5,
"completions/min_terminated_length": 67.5,
"entropy": 0.045563413738273086,
"epoch": 28.58672376873662,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0830078125,
"learning_rate": 8.665100000000001e-06,
"loss": -0.0098,
"num_tokens": 1317861979.0,
"reward": 1.050585961341858,
"reward_std": 0.18439449816942216,
"rewards/reward_accuracy/mean": 0.951171875,
"rewards/reward_accuracy/std": 0.18156112134456634,
"rewards/reward_format/mean": 0.09941406399011612,
"rewards/reward_format/std": 0.00466399472206831,
"sampling/importance_sampling_ratio/max": 2.3432225823402404,
"sampling/importance_sampling_ratio/mean": 0.9811681091785431,
"sampling/importance_sampling_ratio/min": 0.15090913688763977,
"sampling/sampling_logp_difference/max": 0.9385969161987304,
"sampling/sampling_logp_difference/mean": 0.004195587104186415,
"step": 13350,
"step_time": 6.799440058492474
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1250.9,
"completions/max_terminated_length": 1009.4,
"completions/mean_length": 152.709375,
"completions/mean_terminated_length": 147.5947593688965,
"completions/min_length": 69.1,
"completions/min_terminated_length": 69.1,
"entropy": 0.04146161309909076,
"epoch": 28.60813704496788,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.55078125,
"learning_rate": 8.6641e-06,
"loss": -0.0044,
"num_tokens": 1318772659.0,
"reward": 1.065039086341858,
"reward_std": 0.13128614649176598,
"rewards/reward_accuracy/mean": 0.965234375,
"rewards/reward_accuracy/std": 0.1303621746599674,
"rewards/reward_format/mean": 0.09980468899011612,
"rewards/reward_format/std": 0.002405522926710546,
"sampling/importance_sampling_ratio/max": 2.59365553855896,
"sampling/importance_sampling_ratio/mean": 0.9919663906097412,
"sampling/importance_sampling_ratio/min": 0.14915448427200317,
"sampling/sampling_logp_difference/max": 1.1858470916748047,
"sampling/sampling_logp_difference/mean": 0.004201316041871905,
"step": 13360,
"step_time": 6.11829530367977
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1496.5,
"completions/max_terminated_length": 1213.6,
"completions/mean_length": 166.951171875,
"completions/mean_terminated_length": 157.35094146728517,
"completions/min_length": 67.3,
"completions/min_terminated_length": 67.3,
"entropy": 0.04176438362337649,
"epoch": 28.629550321199144,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.6631e-06,
"loss": -0.0083,
"num_tokens": 1319716998.0,
"reward": 1.0794336080551148,
"reward_std": 0.11118754595518113,
"rewards/reward_accuracy/mean": 0.9796875,
"rewards/reward_accuracy/std": 0.10928247421979904,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.0033267974620684983,
"sampling/importance_sampling_ratio/max": 2.5813031911849977,
"sampling/importance_sampling_ratio/mean": 0.988639235496521,
"sampling/importance_sampling_ratio/min": 0.06881621181964874,
"sampling/sampling_logp_difference/max": 0.9771697402000428,
"sampling/sampling_logp_difference/mean": 0.0038716162089258432,
"step": 13370,
"step_time": 7.305911051217118
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1761.8,
"completions/max_terminated_length": 1360.2,
"completions/mean_length": 154.25859375,
"completions/mean_terminated_length": 149.11319580078126,
"completions/min_length": 62.9,
"completions/min_terminated_length": 62.9,
"entropy": 0.04288517297245562,
"epoch": 28.650963597430408,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.058349609375,
"learning_rate": 8.662100000000001e-06,
"loss": 0.001,
"num_tokens": 1320632204.0,
"reward": 1.0806054830551148,
"reward_std": 0.10765632316470146,
"rewards/reward_accuracy/mean": 0.980859375,
"rewards/reward_accuracy/std": 0.10579677298665047,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.0031386925373226406,
"sampling/importance_sampling_ratio/max": 2.4391295194625853,
"sampling/importance_sampling_ratio/mean": 0.9908048808574677,
"sampling/importance_sampling_ratio/min": 0.0888790287077427,
"sampling/sampling_logp_difference/max": 0.9390874862670898,
"sampling/sampling_logp_difference/mean": 0.0041700749890878795,
"step": 13380,
"step_time": 8.373503751406679
},
{
"clip_ratio/high_max": 4.57763671875e-06,
"clip_ratio/high_mean": 5.7220458984375e-07,
"clip_ratio/low_mean": 5.7220458984375e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.1444091796875e-06,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 837.1,
"completions/max_terminated_length": 779.6,
"completions/mean_length": 155.517578125,
"completions/mean_terminated_length": 143.76878814697267,
"completions/min_length": 63.5,
"completions/min_terminated_length": 63.5,
"entropy": 0.03866934289690107,
"epoch": 28.67237687366167,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0,
"learning_rate": 8.6611e-06,
"loss": -0.0052,
"num_tokens": 1321545177.0,
"reward": 1.0655078291893005,
"reward_std": 0.11501811295747758,
"rewards/reward_accuracy/mean": 0.966015625,
"rewards/reward_accuracy/std": 0.11320163309574127,
"rewards/reward_format/mean": 0.09949218779802323,
"rewards/reward_format/std": 0.00350017910823226,
"sampling/importance_sampling_ratio/max": 2.4583097815513613,
"sampling/importance_sampling_ratio/mean": 0.9932758808135986,
"sampling/importance_sampling_ratio/min": 0.15996073000133038,
"sampling/sampling_logp_difference/max": 0.9682861924171448,
"sampling/sampling_logp_difference/mean": 0.003738221013918519,
"step": 13390,
"step_time": 4.715537398413289
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1616.9,
"completions/max_terminated_length": 1481.7,
"completions/mean_length": 183.290625,
"completions/mean_terminated_length": 171.10153350830078,
"completions/min_length": 67.9,
"completions/min_terminated_length": 67.9,
"entropy": 0.04948350496124476,
"epoch": 28.693790149892934,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 8.6601e-06,
"loss": -0.0055,
"num_tokens": 1322538385.0,
"reward": 1.063652354478836,
"reward_std": 0.1443592156516388,
"rewards/reward_accuracy/mean": 0.9640625,
"rewards/reward_accuracy/std": 0.1424756646156311,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.004751032846979797,
"sampling/importance_sampling_ratio/max": 2.698265814781189,
"sampling/importance_sampling_ratio/mean": 0.9927025735378265,
"sampling/importance_sampling_ratio/min": 0.1164263792335987,
"sampling/sampling_logp_difference/max": 1.0405507683753967,
"sampling/sampling_logp_difference/mean": 0.004273313330486417,
"step": 13400,
"step_time": 7.8978851174062585
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1448.1,
"completions/max_terminated_length": 1102.1,
"completions/mean_length": 158.5296875,
"completions/mean_terminated_length": 154.10269012451172,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.03955487695056945,
"epoch": 28.715203426124198,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.3203125,
"learning_rate": 8.6591e-06,
"loss": -0.0022,
"num_tokens": 1323462077.0,
"reward": 1.0670507907867433,
"reward_std": 0.13701381757855416,
"rewards/reward_accuracy/mean": 0.9671875,
"rewards/reward_accuracy/std": 0.1354655534029007,
"rewards/reward_format/mean": 0.09986328184604645,
"rewards/reward_format/std": 0.002187500172294676,
"sampling/importance_sampling_ratio/max": 2.5315353631973267,
"sampling/importance_sampling_ratio/mean": 0.9944559752941131,
"sampling/importance_sampling_ratio/min": 0.09612968415021897,
"sampling/sampling_logp_difference/max": 0.9020715892314911,
"sampling/sampling_logp_difference/mean": 0.004013176262378693,
"step": 13410,
"step_time": 6.966815597293317
},
{
"clip_ratio/high_max": 7.955449837027117e-06,
"clip_ratio/high_mean": 9.944312296283897e-07,
"clip_ratio/low_mean": 1.6980944110400742e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.692525640668464e-06,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1234.3,
"completions/max_terminated_length": 1024.2,
"completions/mean_length": 156.99921875,
"completions/mean_terminated_length": 145.13629608154298,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"entropy": 0.0393114332575351,
"epoch": 28.73661670235546,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.658100000000001e-06,
"loss": -0.0052,
"num_tokens": 1324376571.0,
"reward": 1.0533007979393005,
"reward_std": 0.16355677023530008,
"rewards/reward_accuracy/mean": 0.95390625,
"rewards/reward_accuracy/std": 0.16111503690481185,
"rewards/reward_format/mean": 0.09939453229308129,
"rewards/reward_format/std": 0.00404761761892587,
"sampling/importance_sampling_ratio/max": 2.373323106765747,
"sampling/importance_sampling_ratio/mean": 0.9826006114482879,
"sampling/importance_sampling_ratio/min": 0.11650096140801906,
"sampling/sampling_logp_difference/max": 1.1712202250957489,
"sampling/sampling_logp_difference/mean": 0.0037349846679717302,
"step": 13420,
"step_time": 6.2111296516057335
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1758.4,
"completions/max_terminated_length": 1435.9,
"completions/mean_length": 173.5546875,
"completions/mean_terminated_length": 160.49061889648436,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.05214781563263386,
"epoch": 28.758029978586723,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.0,
"learning_rate": 8.6571e-06,
"loss": -0.007,
"num_tokens": 1325337687.0,
"reward": 1.0545117259025574,
"reward_std": 0.1811974488198757,
"rewards/reward_accuracy/mean": 0.955078125,
"rewards/reward_accuracy/std": 0.17908794954419135,
"rewards/reward_format/mean": 0.09943359419703483,
"rewards/reward_format/std": 0.004711332963779569,
"sampling/importance_sampling_ratio/max": 2.5997239112854005,
"sampling/importance_sampling_ratio/mean": 0.9861128568649292,
"sampling/importance_sampling_ratio/min": 0.06088433526456356,
"sampling/sampling_logp_difference/max": 1.1384652376174926,
"sampling/sampling_logp_difference/mean": 0.004528118809685111,
"step": 13430,
"step_time": 8.449056662103976
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1422.5,
"completions/max_terminated_length": 1177.5,
"completions/mean_length": 167.223046875,
"completions/mean_terminated_length": 154.79195251464844,
"completions/min_length": 62.0,
"completions/min_terminated_length": 62.0,
"entropy": 0.0458754010964185,
"epoch": 28.779443254817988,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.119140625,
"learning_rate": 8.6561e-06,
"loss": -0.003,
"num_tokens": 1326281810.0,
"reward": 1.052011752128601,
"reward_std": 0.17828180864453316,
"rewards/reward_accuracy/mean": 0.952734375,
"rewards/reward_accuracy/std": 0.17481152936816216,
"rewards/reward_format/mean": 0.09927734583616257,
"rewards/reward_format/std": 0.005726777762174606,
"sampling/importance_sampling_ratio/max": 2.434889316558838,
"sampling/importance_sampling_ratio/mean": 0.9861263453960418,
"sampling/importance_sampling_ratio/min": 0.1285208761692047,
"sampling/sampling_logp_difference/max": 0.9156582832336426,
"sampling/sampling_logp_difference/mean": 0.003946286486461758,
"step": 13440,
"step_time": 7.066261666608625
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1423.6,
"completions/max_terminated_length": 1138.1,
"completions/mean_length": 147.368359375,
"completions/mean_terminated_length": 142.95601806640624,
"completions/min_length": 64.7,
"completions/min_terminated_length": 64.7,
"entropy": 0.03765752038452774,
"epoch": 28.800856531049252,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0,
"learning_rate": 8.655100000000001e-06,
"loss": -0.0051,
"num_tokens": 1327178881.0,
"reward": 1.0646093845367433,
"reward_std": 0.13803747147321702,
"rewards/reward_accuracy/mean": 0.96484375,
"rewards/reward_accuracy/std": 0.13701671585440636,
"rewards/reward_format/mean": 0.09976562559604644,
"rewards/reward_format/std": 0.0031217265175655486,
"sampling/importance_sampling_ratio/max": 2.4503806948661806,
"sampling/importance_sampling_ratio/mean": 0.986520254611969,
"sampling/importance_sampling_ratio/min": 0.1571245739236474,
"sampling/sampling_logp_difference/max": 1.074075663089752,
"sampling/sampling_logp_difference/mean": 0.003795016510412097,
"step": 13450,
"step_time": 6.821210692703607
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1288.0,
"completions/max_terminated_length": 723.4,
"completions/mean_length": 150.0890625,
"completions/mean_terminated_length": 142.7114288330078,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.037257665977813305,
"epoch": 28.822269807280513,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.2412109375,
"learning_rate": 8.6541e-06,
"loss": -0.0068,
"num_tokens": 1328081013.0,
"reward": 1.0696680009365083,
"reward_std": 0.13542125150561332,
"rewards/reward_accuracy/mean": 0.969921875,
"rewards/reward_accuracy/std": 0.1338084101676941,
"rewards/reward_format/mean": 0.09974609538912774,
"rewards/reward_format/std": 0.0033267974155023693,
"sampling/importance_sampling_ratio/max": 2.4226679682731627,
"sampling/importance_sampling_ratio/mean": 0.9863111853599549,
"sampling/importance_sampling_ratio/min": 0.14435375705361367,
"sampling/sampling_logp_difference/max": 0.8924683690071106,
"sampling/sampling_logp_difference/mean": 0.0038299089530482886,
"step": 13460,
"step_time": 6.296936679404462
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1501.7,
"completions/max_terminated_length": 1296.9,
"completions/mean_length": 178.88671875,
"completions/mean_terminated_length": 166.60497131347657,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.04920613078866154,
"epoch": 28.843683083511777,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.19140625,
"learning_rate": 8.6531e-06,
"loss": -0.0095,
"num_tokens": 1329058227.0,
"reward": 1.0561328411102295,
"reward_std": 0.1810038447380066,
"rewards/reward_accuracy/mean": 0.956640625,
"rewards/reward_accuracy/std": 0.17869466096162795,
"rewards/reward_format/mean": 0.09949218928813934,
"rewards/reward_format/std": 0.004912897851318121,
"sampling/importance_sampling_ratio/max": 2.442817759513855,
"sampling/importance_sampling_ratio/mean": 0.9793630838394165,
"sampling/importance_sampling_ratio/min": 0.06591777633875609,
"sampling/sampling_logp_difference/max": 1.1863192200660706,
"sampling/sampling_logp_difference/mean": 0.004079101048409939,
"step": 13470,
"step_time": 7.4995839783019616
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1089.5,
"completions/max_terminated_length": 905.4,
"completions/mean_length": 153.290234375,
"completions/mean_terminated_length": 150.32003326416014,
"completions/min_length": 60.7,
"completions/min_terminated_length": 60.7,
"entropy": 0.03321656873449683,
"epoch": 28.865096359743042,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.0,
"learning_rate": 8.652100000000001e-06,
"loss": -0.0036,
"num_tokens": 1329965690.0,
"reward": 1.0834375143051147,
"reward_std": 0.09193960726261138,
"rewards/reward_accuracy/mean": 0.98359375,
"rewards/reward_accuracy/std": 0.0904661625623703,
"rewards/reward_format/mean": 0.09984375089406967,
"rewards/reward_format/std": 0.002316074492409825,
"sampling/importance_sampling_ratio/max": 2.5098204374313355,
"sampling/importance_sampling_ratio/mean": 0.9873760938644409,
"sampling/importance_sampling_ratio/min": 0.11335547119379044,
"sampling/sampling_logp_difference/max": 0.9262832045555115,
"sampling/sampling_logp_difference/mean": 0.0033665085211396217,
"step": 13480,
"step_time": 5.4918837642937435
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1559.9,
"completions/max_terminated_length": 1388.5,
"completions/mean_length": 153.85859375,
"completions/mean_terminated_length": 148.04632568359375,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.041949850996024905,
"epoch": 28.886509635974303,
"frac_reward_zero_std": 0.9125,
"grad_norm": 1.6796875,
"learning_rate": 8.651100000000001e-06,
"loss": -0.0032,
"num_tokens": 1330877456.0,
"reward": 1.0516796946525573,
"reward_std": 0.1824403665959835,
"rewards/reward_accuracy/mean": 0.951953125,
"rewards/reward_accuracy/std": 0.18121974691748619,
"rewards/reward_format/mean": 0.09972656294703483,
"rewards/reward_format/std": 0.0030360511038452385,
"sampling/importance_sampling_ratio/max": 2.551219606399536,
"sampling/importance_sampling_ratio/mean": 0.9893717348575592,
"sampling/importance_sampling_ratio/min": 0.09202650599181653,
"sampling/sampling_logp_difference/max": 0.9553692698478699,
"sampling/sampling_logp_difference/mean": 0.0040679161436855795,
"step": 13490,
"step_time": 7.3668166288232895
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1362.1,
"completions/max_terminated_length": 1190.1,
"completions/mean_length": 155.832421875,
"completions/mean_terminated_length": 149.90319366455077,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.04148658756166697,
"epoch": 28.907922912205567,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.0,
"learning_rate": 8.6501e-06,
"loss": -0.01,
"num_tokens": 1331790419.0,
"reward": 1.0755273699760437,
"reward_std": 0.13362534269690513,
"rewards/reward_accuracy/mean": 0.97578125,
"rewards/reward_accuracy/std": 0.131872970610857,
"rewards/reward_format/mean": 0.09974609538912774,
"rewards/reward_format/std": 0.00256529962643981,
"sampling/importance_sampling_ratio/max": 2.5164340019226072,
"sampling/importance_sampling_ratio/mean": 0.9836475372314453,
"sampling/importance_sampling_ratio/min": 0.0876692071557045,
"sampling/sampling_logp_difference/max": 0.9985694766044617,
"sampling/sampling_logp_difference/mean": 0.004004422784782946,
"step": 13500,
"step_time": 6.552800070599187
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1031.3,
"completions/max_terminated_length": 893.0,
"completions/mean_length": 152.961328125,
"completions/mean_terminated_length": 148.61420288085938,
"completions/min_length": 69.6,
"completions/min_terminated_length": 69.6,
"entropy": 0.03719801197294146,
"epoch": 28.92933618843683,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.455078125,
"learning_rate": 8.6491e-06,
"loss": -0.0016,
"num_tokens": 1332707168.0,
"reward": 1.0831250071525573,
"reward_std": 0.09021495282649994,
"rewards/reward_accuracy/mean": 0.983203125,
"rewards/reward_accuracy/std": 0.08952970281243325,
"rewards/reward_format/mean": 0.09992187544703483,
"rewards/reward_format/std": 0.0012500000651925803,
"sampling/importance_sampling_ratio/max": 2.273599052429199,
"sampling/importance_sampling_ratio/mean": 0.9841268420219421,
"sampling/importance_sampling_ratio/min": 0.1387216579169035,
"sampling/sampling_logp_difference/max": 1.0105581402778625,
"sampling/sampling_logp_difference/mean": 0.0035530549474060537,
"step": 13510,
"step_time": 5.229161040604231
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1678.8,
"completions/max_terminated_length": 1185.8,
"completions/mean_length": 164.8546875,
"completions/mean_terminated_length": 157.48190612792968,
"completions/min_length": 63.9,
"completions/min_terminated_length": 63.9,
"entropy": 0.039031516294926405,
"epoch": 28.950749464668093,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.453125,
"learning_rate": 8.648100000000001e-06,
"loss": -0.0065,
"num_tokens": 1333648860.0,
"reward": 1.0755273461341859,
"reward_std": 0.1395636223256588,
"rewards/reward_accuracy/mean": 0.97578125,
"rewards/reward_accuracy/std": 0.13720996379852296,
"rewards/reward_format/mean": 0.09974609389901161,
"rewards/reward_format/std": 0.0032657783711329104,
"sampling/importance_sampling_ratio/max": 2.4700446844100954,
"sampling/importance_sampling_ratio/mean": 0.9912012219429016,
"sampling/importance_sampling_ratio/min": 0.05253768637776375,
"sampling/sampling_logp_difference/max": 1.0886497020721435,
"sampling/sampling_logp_difference/mean": 0.003876595664769411,
"step": 13520,
"step_time": 7.805397896899376
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1351.1,
"completions/max_terminated_length": 1126.0,
"completions/mean_length": 147.240625,
"completions/mean_terminated_length": 144.28390502929688,
"completions/min_length": 62.6,
"completions/min_terminated_length": 62.6,
"entropy": 0.038092373148538174,
"epoch": 28.972162740899357,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.6471e-06,
"loss": -0.0032,
"num_tokens": 1334548340.0,
"reward": 1.0800000071525573,
"reward_std": 0.11371592804789543,
"rewards/reward_accuracy/mean": 0.980078125,
"rewards/reward_accuracy/std": 0.11321953684091568,
"rewards/reward_format/mean": 0.09992187544703483,
"rewards/reward_format/std": 0.0012500000651925803,
"sampling/importance_sampling_ratio/max": 2.503906559944153,
"sampling/importance_sampling_ratio/mean": 0.984281599521637,
"sampling/importance_sampling_ratio/min": 0.12279928661882877,
"sampling/sampling_logp_difference/max": 1.3292750239372253,
"sampling/sampling_logp_difference/mean": 0.0040652174036949875,
"step": 13530,
"step_time": 6.546325036993949
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.9131871340505313e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.9131871340505313e-07,
"completions/clipped_ratio": 0.0140625,
"completions/max_length": 1453.6,
"completions/max_terminated_length": 1380.5,
"completions/mean_length": 189.26484375,
"completions/mean_terminated_length": 162.9552764892578,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.04698131708428264,
"epoch": 28.99357601713062,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.34765625,
"learning_rate": 8.6461e-06,
"loss": -0.0025,
"num_tokens": 1335553002.0,
"reward": 1.0608203411102295,
"reward_std": 0.1509523242712021,
"rewards/reward_accuracy/mean": 0.962109375,
"rewards/reward_accuracy/std": 0.14617098569869996,
"rewards/reward_format/mean": 0.09871093928813934,
"rewards/reward_format/std": 0.007566915359348059,
"sampling/importance_sampling_ratio/max": 2.527243196964264,
"sampling/importance_sampling_ratio/mean": 0.9825223088264465,
"sampling/importance_sampling_ratio/min": 0.08888352513313294,
"sampling/sampling_logp_difference/max": 1.1124743223190308,
"sampling/sampling_logp_difference/mean": 0.00415046364068985,
"step": 13540,
"step_time": 7.693340657098451
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.6382921078038636e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.6382921078038636e-06,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1236.7,
"completions/max_terminated_length": 1207.9,
"completions/mean_length": 162.184765625,
"completions/mean_terminated_length": 151.12730865478517,
"completions/min_length": 61.7,
"completions/min_terminated_length": 61.7,
"entropy": 0.04213880251627415,
"epoch": 29.014989293361886,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0,
"learning_rate": 8.645100000000001e-06,
"loss": -0.0032,
"num_tokens": 1336483811.0,
"reward": 1.0587109565734862,
"reward_std": 0.15439641177654267,
"rewards/reward_accuracy/mean": 0.959375,
"rewards/reward_accuracy/std": 0.15251443088054656,
"rewards/reward_format/mean": 0.09933594092726708,
"rewards/reward_format/std": 0.003841251786798239,
"sampling/importance_sampling_ratio/max": 2.2951364755630492,
"sampling/importance_sampling_ratio/mean": 0.9907105147838593,
"sampling/importance_sampling_ratio/min": 0.18587019965052604,
"sampling/sampling_logp_difference/max": 0.9516998529434204,
"sampling/sampling_logp_difference/mean": 0.003785359254106879,
"step": 13550,
"step_time": 6.1580931700096695
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1038.4,
"completions/max_terminated_length": 979.4,
"completions/mean_length": 150.321484375,
"completions/mean_terminated_length": 145.1655487060547,
"completions/min_length": 62.0,
"completions/min_terminated_length": 62.0,
"entropy": 0.03630042679142207,
"epoch": 29.036402569593147,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.2490234375,
"learning_rate": 8.6441e-06,
"loss": -0.0018,
"num_tokens": 1337390426.0,
"reward": 1.0751562714576721,
"reward_std": 0.1200946256518364,
"rewards/reward_accuracy/mean": 0.975390625,
"rewards/reward_accuracy/std": 0.11875532642006874,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0023152486653998496,
"sampling/importance_sampling_ratio/max": 2.4397063970565798,
"sampling/importance_sampling_ratio/mean": 0.9857013881206512,
"sampling/importance_sampling_ratio/min": 0.21692558266222478,
"sampling/sampling_logp_difference/max": 1.1942522346973419,
"sampling/sampling_logp_difference/mean": 0.003916901675984264,
"step": 13560,
"step_time": 5.227530273594311
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1329.3,
"completions/max_terminated_length": 1244.9,
"completions/mean_length": 156.8625,
"completions/mean_terminated_length": 151.7614517211914,
"completions/min_length": 61.6,
"completions/min_terminated_length": 61.6,
"entropy": 0.04182935089338571,
"epoch": 29.05781584582441,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.328125,
"learning_rate": 8.6431e-06,
"loss": -0.0079,
"num_tokens": 1338308490.0,
"reward": 1.0391601920127869,
"reward_std": 0.1909019887447357,
"rewards/reward_accuracy/mean": 0.939453125,
"rewards/reward_accuracy/std": 0.1893765665590763,
"rewards/reward_format/mean": 0.09970703274011612,
"rewards/reward_format/std": 0.0028018517419695853,
"sampling/importance_sampling_ratio/max": 2.395717537403107,
"sampling/importance_sampling_ratio/mean": 0.9800125300884247,
"sampling/importance_sampling_ratio/min": 0.06919333785772323,
"sampling/sampling_logp_difference/max": 1.3953155517578124,
"sampling/sampling_logp_difference/mean": 0.0040928831091150645,
"step": 13570,
"step_time": 6.502246773699881
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1090.6,
"completions/max_terminated_length": 850.0,
"completions/mean_length": 141.64296875,
"completions/mean_terminated_length": 134.26597442626954,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.03721581562422216,
"epoch": 29.079229122055676,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.27734375,
"learning_rate": 8.642100000000002e-06,
"loss": -0.0101,
"num_tokens": 1339184568.0,
"reward": 1.0868750214576721,
"reward_std": 0.08448060527443886,
"rewards/reward_accuracy/mean": 0.987109375,
"rewards/reward_accuracy/std": 0.08299339190125465,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0022276924923062325,
"sampling/importance_sampling_ratio/max": 2.180188512802124,
"sampling/importance_sampling_ratio/mean": 0.9791259765625,
"sampling/importance_sampling_ratio/min": 0.14747859723865986,
"sampling/sampling_logp_difference/max": 1.0103541791439057,
"sampling/sampling_logp_difference/mean": 0.0037449106806889177,
"step": 13580,
"step_time": 5.448605976090766
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1299.3,
"completions/max_terminated_length": 1139.5,
"completions/mean_length": 162.891796875,
"completions/mean_terminated_length": 151.91781768798828,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.04007688304409385,
"epoch": 29.100642398286936,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.1796875,
"learning_rate": 8.641100000000001e-06,
"loss": -0.0042,
"num_tokens": 1340118403.0,
"reward": 1.079980492591858,
"reward_std": 0.11099637150764466,
"rewards/reward_accuracy/mean": 0.98046875,
"rewards/reward_accuracy/std": 0.10885573029518128,
"rewards/reward_format/mean": 0.09951171949505806,
"rewards/reward_format/std": 0.0034621131606400015,
"sampling/importance_sampling_ratio/max": 2.4946915745735168,
"sampling/importance_sampling_ratio/mean": 0.9932330906391144,
"sampling/importance_sampling_ratio/min": 0.1626177234807983,
"sampling/sampling_logp_difference/max": 1.004151451587677,
"sampling/sampling_logp_difference/mean": 0.0038350450107827783,
"step": 13590,
"step_time": 6.335449942207196
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1109.6,
"completions/max_terminated_length": 804.0,
"completions/mean_length": 139.187109375,
"completions/mean_terminated_length": 135.48175811767578,
"completions/min_length": 60.9,
"completions/min_terminated_length": 60.9,
"entropy": 0.03487482939381152,
"epoch": 29.1220556745182,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.447265625,
"learning_rate": 8.6401e-06,
"loss": -0.0061,
"num_tokens": 1340986514.0,
"reward": 1.0780468821525573,
"reward_std": 0.10102800354361534,
"rewards/reward_accuracy/mean": 0.978125,
"rewards/reward_accuracy/std": 0.10048832148313522,
"rewards/reward_format/mean": 0.09992187544703483,
"rewards/reward_format/std": 0.0012500000651925803,
"sampling/importance_sampling_ratio/max": 2.3710538029670714,
"sampling/importance_sampling_ratio/mean": 0.9863971412181854,
"sampling/importance_sampling_ratio/min": 0.19466867465525867,
"sampling/sampling_logp_difference/max": 1.0476129531860352,
"sampling/sampling_logp_difference/mean": 0.0037735250080004334,
"step": 13600,
"step_time": 5.434207229290041
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1053.5,
"completions/max_terminated_length": 884.7,
"completions/mean_length": 157.26484375,
"completions/mean_terminated_length": 152.87651519775392,
"completions/min_length": 63.5,
"completions/min_terminated_length": 63.5,
"entropy": 0.03759959067683667,
"epoch": 29.143468950749465,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.6391e-06,
"loss": -0.0049,
"num_tokens": 1341906904.0,
"reward": 1.0748242497444154,
"reward_std": 0.11951940879225731,
"rewards/reward_accuracy/mean": 0.975,
"rewards/reward_accuracy/std": 0.11857614740729332,
"rewards/reward_format/mean": 0.09982422068715095,
"rewards/reward_format/std": 0.0022048230282962324,
"sampling/importance_sampling_ratio/max": 2.5243688821792603,
"sampling/importance_sampling_ratio/mean": 0.9872109174728394,
"sampling/importance_sampling_ratio/min": 0.11046669334173202,
"sampling/sampling_logp_difference/max": 1.6186587810516357,
"sampling/sampling_logp_difference/mean": 0.003748582350090146,
"step": 13610,
"step_time": 5.298325256691896
},
{
"clip_ratio/high_max": 7.307725463761017e-05,
"clip_ratio/high_mean": 9.134656829701271e-06,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 9.134656829701271e-06,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1168.3,
"completions/max_terminated_length": 1154.3,
"completions/mean_length": 150.530859375,
"completions/mean_terminated_length": 145.49354400634766,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.036862900969572364,
"epoch": 29.16488222698073,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.287109375,
"learning_rate": 8.638100000000001e-06,
"loss": -0.0036,
"num_tokens": 1342807431.0,
"reward": 1.0685156345367433,
"reward_std": 0.11967021003365516,
"rewards/reward_accuracy/mean": 0.96875,
"rewards/reward_accuracy/std": 0.1191460758447647,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.001860177074559033,
"sampling/importance_sampling_ratio/max": 2.4014355421066282,
"sampling/importance_sampling_ratio/mean": 0.9973724901676178,
"sampling/importance_sampling_ratio/min": 0.15047264881432057,
"sampling/sampling_logp_difference/max": 1.1021100878715515,
"sampling/sampling_logp_difference/mean": 0.0037436498329043387,
"step": 13620,
"step_time": 5.679382462590001
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1221.0,
"completions/max_terminated_length": 1141.6,
"completions/mean_length": 160.840234375,
"completions/mean_terminated_length": 150.70293884277345,
"completions/min_length": 70.6,
"completions/min_terminated_length": 70.6,
"entropy": 0.04135324556846172,
"epoch": 29.18629550321199,
"frac_reward_zero_std": 0.9375,
"grad_norm": 1.34375,
"learning_rate": 8.6371e-06,
"loss": -0.0062,
"num_tokens": 1343739790.0,
"reward": 1.0437695562839509,
"reward_std": 0.1912529982626438,
"rewards/reward_accuracy/mean": 0.944140625,
"rewards/reward_accuracy/std": 0.18986762017011644,
"rewards/reward_format/mean": 0.09962890744209289,
"rewards/reward_format/std": 0.002789715398102999,
"sampling/importance_sampling_ratio/max": 2.6401543855667113,
"sampling/importance_sampling_ratio/mean": 0.9962681531906128,
"sampling/importance_sampling_ratio/min": 0.11507549583911895,
"sampling/sampling_logp_difference/max": 1.1823377013206482,
"sampling/sampling_logp_difference/mean": 0.003998251934535802,
"step": 13630,
"step_time": 6.238324255897896
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1040.2,
"completions/max_terminated_length": 747.1,
"completions/mean_length": 148.98984375,
"completions/mean_terminated_length": 141.03026657104493,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.040850954689085485,
"epoch": 29.207708779443255,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.04736328125,
"learning_rate": 8.6361e-06,
"loss": -0.0042,
"num_tokens": 1344641092.0,
"reward": 1.0676562666893006,
"reward_std": 0.11371914818882942,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.11240407004952431,
"rewards/reward_format/mean": 0.09968750104308129,
"rewards/reward_format/std": 0.002765847835689783,
"sampling/importance_sampling_ratio/max": 2.437216019630432,
"sampling/importance_sampling_ratio/mean": 0.9913498282432556,
"sampling/importance_sampling_ratio/min": 0.08896363526582718,
"sampling/sampling_logp_difference/max": 1.0880030751228333,
"sampling/sampling_logp_difference/mean": 0.003991693002171814,
"step": 13640,
"step_time": 5.079485483808094
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1610.6,
"completions/max_terminated_length": 1286.0,
"completions/mean_length": 169.073828125,
"completions/mean_terminated_length": 157.33460388183593,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.045748764812014994,
"epoch": 29.22912205567452,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.1357421875,
"learning_rate": 8.635100000000001e-06,
"loss": 0.0003,
"num_tokens": 1345593825.0,
"reward": 1.0512304842472076,
"reward_std": 0.1945239059627056,
"rewards/reward_accuracy/mean": 0.9515625,
"rewards/reward_accuracy/std": 0.19293890073895453,
"rewards/reward_format/mean": 0.09966796934604645,
"rewards/reward_format/std": 0.003814995544962585,
"sampling/importance_sampling_ratio/max": 2.6675896644592285,
"sampling/importance_sampling_ratio/mean": 0.9896510601043701,
"sampling/importance_sampling_ratio/min": 0.11905708014965058,
"sampling/sampling_logp_difference/max": 1.0359567999839783,
"sampling/sampling_logp_difference/mean": 0.004016051697544753,
"step": 13650,
"step_time": 7.826839788490906
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1462.7,
"completions/max_terminated_length": 781.9,
"completions/mean_length": 146.0,
"completions/mean_terminated_length": 139.33913040161133,
"completions/min_length": 61.8,
"completions/min_terminated_length": 61.8,
"entropy": 0.03616319135762751,
"epoch": 29.25053533190578,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.068359375,
"learning_rate": 8.634100000000001e-06,
"loss": -0.0052,
"num_tokens": 1346487249.0,
"reward": 1.0763086020946502,
"reward_std": 0.10791454464197159,
"rewards/reward_accuracy/mean": 0.9765625,
"rewards/reward_accuracy/std": 0.10588111653923989,
"rewards/reward_format/mean": 0.09974609389901161,
"rewards/reward_format/std": 0.0032657784642651675,
"sampling/importance_sampling_ratio/max": 2.418879044055939,
"sampling/importance_sampling_ratio/mean": 0.982968008518219,
"sampling/importance_sampling_ratio/min": 0.11994508653879166,
"sampling/sampling_logp_difference/max": 0.8427931725978851,
"sampling/sampling_logp_difference/mean": 0.0039028091123327613,
"step": 13660,
"step_time": 6.817197072718409
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 978.9,
"completions/max_terminated_length": 949.2,
"completions/mean_length": 152.13828125,
"completions/mean_terminated_length": 146.26058807373047,
"completions/min_length": 68.1,
"completions/min_terminated_length": 68.1,
"entropy": 0.03664393939543516,
"epoch": 29.271948608137045,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.0,
"learning_rate": 8.6331e-06,
"loss": -0.0012,
"num_tokens": 1347392259.0,
"reward": 1.0914648652076722,
"reward_std": 0.051034900546073916,
"rewards/reward_accuracy/mean": 0.991796875,
"rewards/reward_accuracy/std": 0.04914684593677521,
"rewards/reward_format/mean": 0.09966797009110451,
"rewards/reward_format/std": 0.002710496471263468,
"sampling/importance_sampling_ratio/max": 2.520780110359192,
"sampling/importance_sampling_ratio/mean": 0.9927552580833435,
"sampling/importance_sampling_ratio/min": 0.16941798180341722,
"sampling/sampling_logp_difference/max": 0.9244238376617432,
"sampling/sampling_logp_difference/mean": 0.003676420054398477,
"step": 13670,
"step_time": 5.041417353705038
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1162.0,
"completions/max_terminated_length": 1079.7,
"completions/mean_length": 149.032421875,
"completions/mean_terminated_length": 146.83265838623046,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.04349637015257031,
"epoch": 29.29336188436831,
"frac_reward_zero_std": 0.93125,
"grad_norm": 1.0234375,
"learning_rate": 8.632100000000002e-06,
"loss": -0.0015,
"num_tokens": 1348294822.0,
"reward": 1.0783203482627868,
"reward_std": 0.11152797043323517,
"rewards/reward_accuracy/mean": 0.978515625,
"rewards/reward_accuracy/std": 0.11047788262367249,
"rewards/reward_format/mean": 0.09980468973517417,
"rewards/reward_format/std": 0.0021509199403226377,
"sampling/importance_sampling_ratio/max": 2.3423485279083254,
"sampling/importance_sampling_ratio/mean": 0.9883217096328736,
"sampling/importance_sampling_ratio/min": 0.10632854998111725,
"sampling/sampling_logp_difference/max": 0.8690650284290313,
"sampling/sampling_logp_difference/mean": 0.0041899200528860096,
"step": 13680,
"step_time": 5.739411623199703
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1485.3,
"completions/max_terminated_length": 1291.3,
"completions/mean_length": 166.012890625,
"completions/mean_terminated_length": 152.69354248046875,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.04647454905789346,
"epoch": 29.31477516059957,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.369140625,
"learning_rate": 8.631100000000001e-06,
"loss": 0.0009,
"num_tokens": 1349235623.0,
"reward": 1.0460742354393004,
"reward_std": 0.1942950375378132,
"rewards/reward_accuracy/mean": 0.946484375,
"rewards/reward_accuracy/std": 0.19290805160999297,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.0033737865276634695,
"sampling/importance_sampling_ratio/max": 2.4406192779541014,
"sampling/importance_sampling_ratio/mean": 0.9880822658538818,
"sampling/importance_sampling_ratio/min": 0.12448663637042046,
"sampling/sampling_logp_difference/max": 0.9286876797676087,
"sampling/sampling_logp_difference/mean": 0.0040729440515860915,
"step": 13690,
"step_time": 7.352715861296747
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1192.2,
"completions/max_terminated_length": 1078.8,
"completions/mean_length": 164.502734375,
"completions/mean_terminated_length": 154.32403106689452,
"completions/min_length": 62.6,
"completions/min_terminated_length": 62.6,
"entropy": 0.044647011626511815,
"epoch": 29.336188436830835,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.6015625,
"learning_rate": 8.6301e-06,
"loss": -0.0042,
"num_tokens": 1350178702.0,
"reward": 1.0667187750339509,
"reward_std": 0.13100393414497374,
"rewards/reward_accuracy/mean": 0.9671875,
"rewards/reward_accuracy/std": 0.1288149729371071,
"rewards/reward_format/mean": 0.09953125193715096,
"rewards/reward_format/std": 0.004341198061592877,
"sampling/importance_sampling_ratio/max": 2.4915338516235352,
"sampling/importance_sampling_ratio/mean": 0.9810860335826874,
"sampling/importance_sampling_ratio/min": 0.09841836504638195,
"sampling/sampling_logp_difference/max": 1.069758415222168,
"sampling/sampling_logp_difference/mean": 0.003952334797941148,
"step": 13700,
"step_time": 6.074481271204422
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 844.2,
"completions/max_terminated_length": 498.6,
"completions/mean_length": 145.2453125,
"completions/mean_terminated_length": 132.5427261352539,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.032264454010874036,
"epoch": 29.3576017130621,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.6291e-06,
"loss": -0.0004,
"num_tokens": 1351064850.0,
"reward": 1.0770312786102294,
"reward_std": 0.10944025442004204,
"rewards/reward_accuracy/mean": 0.97734375,
"rewards/reward_accuracy/std": 0.10789703130722046,
"rewards/reward_format/mean": 0.09968750178813934,
"rewards/reward_format/std": 0.0022590248845517635,
"sampling/importance_sampling_ratio/max": 2.3856955647468565,
"sampling/importance_sampling_ratio/mean": 0.9913168847560883,
"sampling/importance_sampling_ratio/min": 0.16729176826775075,
"sampling/sampling_logp_difference/max": 1.1136422753334045,
"sampling/sampling_logp_difference/mean": 0.0034798945765942336,
"step": 13710,
"step_time": 4.573629293194972
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 828.1,
"completions/max_terminated_length": 771.4,
"completions/mean_length": 147.209765625,
"completions/mean_terminated_length": 143.53934783935546,
"completions/min_length": 67.3,
"completions/min_terminated_length": 67.3,
"entropy": 0.0362128886859864,
"epoch": 29.379014989293363,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.60546875,
"learning_rate": 8.6281e-06,
"loss": -0.0047,
"num_tokens": 1351959083.0,
"reward": 1.0694922029972076,
"reward_std": 0.10757013261318207,
"rewards/reward_accuracy/mean": 0.96953125,
"rewards/reward_accuracy/std": 0.10740733370184899,
"rewards/reward_format/mean": 0.09996093809604645,
"rewards/reward_format/std": 0.0006250000093132258,
"sampling/importance_sampling_ratio/max": 2.282587444782257,
"sampling/importance_sampling_ratio/mean": 0.9770413517951966,
"sampling/importance_sampling_ratio/min": 0.15456002652645112,
"sampling/sampling_logp_difference/max": 1.0187265396118164,
"sampling/sampling_logp_difference/mean": 0.0037863557459786533,
"step": 13720,
"step_time": 4.32753188040806
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 1091.2,
"completions/max_terminated_length": 1080.1,
"completions/mean_length": 147.49765625,
"completions/mean_terminated_length": 146.76453247070313,
"completions/min_length": 67.3,
"completions/min_terminated_length": 67.3,
"entropy": 0.03498233645223081,
"epoch": 29.400428265524624,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.59375,
"learning_rate": 8.6271e-06,
"loss": -0.0062,
"num_tokens": 1352858133.0,
"reward": 1.0772656321525573,
"reward_std": 0.12074816972017288,
"rewards/reward_accuracy/mean": 0.97734375,
"rewards/reward_accuracy/std": 0.12004447728395462,
"rewards/reward_format/mean": 0.09992187544703483,
"rewards/reward_format/std": 0.0012500000651925803,
"sampling/importance_sampling_ratio/max": 2.5221081733703614,
"sampling/importance_sampling_ratio/mean": 0.9980254888534545,
"sampling/importance_sampling_ratio/min": 0.1798636794090271,
"sampling/sampling_logp_difference/max": 1.2348207354545593,
"sampling/sampling_logp_difference/mean": 0.003821559273637831,
"step": 13730,
"step_time": 5.280300243495731
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1051.1,
"completions/max_terminated_length": 833.1,
"completions/mean_length": 147.895703125,
"completions/mean_terminated_length": 139.83871154785157,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.03779628148768097,
"epoch": 29.42184154175589,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.6261e-06,
"loss": -0.0066,
"num_tokens": 1353747386.0,
"reward": 1.0816601753234862,
"reward_std": 0.0877189353108406,
"rewards/reward_accuracy/mean": 0.98203125,
"rewards/reward_accuracy/std": 0.0859318196773529,
"rewards/reward_format/mean": 0.09962890744209289,
"rewards/reward_format/std": 0.002910412847995758,
"sampling/importance_sampling_ratio/max": 2.3402597308158875,
"sampling/importance_sampling_ratio/mean": 0.9882694959640503,
"sampling/importance_sampling_ratio/min": 0.09566642045974731,
"sampling/sampling_logp_difference/max": 1.0394580602645873,
"sampling/sampling_logp_difference/mean": 0.003863449627533555,
"step": 13740,
"step_time": 5.324290402693441
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1261.8,
"completions/max_terminated_length": 1195.9,
"completions/mean_length": 174.626953125,
"completions/mean_terminated_length": 166.10047454833983,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.04393854176159948,
"epoch": 29.443254817987153,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.1923828125,
"learning_rate": 8.625100000000001e-06,
"loss": -0.006,
"num_tokens": 1354711247.0,
"reward": 1.048144555091858,
"reward_std": 0.20053589567542077,
"rewards/reward_accuracy/mean": 0.9484375,
"rewards/reward_accuracy/std": 0.19945642799139024,
"rewards/reward_format/mean": 0.09970703274011612,
"rewards/reward_format/std": 0.0030622741440311076,
"sampling/importance_sampling_ratio/max": 2.4850844502449037,
"sampling/importance_sampling_ratio/mean": 0.9799624919891358,
"sampling/importance_sampling_ratio/min": 0.10701570846140385,
"sampling/sampling_logp_difference/max": 1.311176335811615,
"sampling/sampling_logp_difference/mean": 0.003893253579735756,
"step": 13750,
"step_time": 6.389590147091075
},
{
"clip_ratio/high_max": 1.6184721607714893e-05,
"clip_ratio/high_mean": 2.0230902009643616e-06,
"clip_ratio/low_mean": 1.1173365237482358e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.1404267247125974e-06,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1398.3,
"completions/max_terminated_length": 1157.8,
"completions/mean_length": 163.921875,
"completions/mean_terminated_length": 140.05044250488282,
"completions/min_length": 61.3,
"completions/min_terminated_length": 61.3,
"entropy": 0.03960950365290046,
"epoch": 29.464668094218414,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.1650390625,
"learning_rate": 8.624100000000001e-06,
"loss": 0.0003,
"num_tokens": 1355648871.0,
"reward": 1.0497656345367432,
"reward_std": 0.19434819519519805,
"rewards/reward_accuracy/mean": 0.95078125,
"rewards/reward_accuracy/std": 0.19010309875011444,
"rewards/reward_format/mean": 0.09898437559604645,
"rewards/reward_format/std": 0.005805279896594584,
"sampling/importance_sampling_ratio/max": 2.3301886081695558,
"sampling/importance_sampling_ratio/mean": 0.9882704377174377,
"sampling/importance_sampling_ratio/min": 0.08545472957193852,
"sampling/sampling_logp_difference/max": 1.2566008687019348,
"sampling/sampling_logp_difference/mean": 0.0038900844985619186,
"step": 13760,
"step_time": 6.968357450113399
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1391.9,
"completions/max_terminated_length": 984.9,
"completions/mean_length": 170.607421875,
"completions/mean_terminated_length": 158.27959747314452,
"completions/min_length": 66.5,
"completions/min_terminated_length": 66.5,
"entropy": 0.043717027688398954,
"epoch": 29.48608137044968,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.1630859375,
"learning_rate": 8.6231e-06,
"loss": -0.0088,
"num_tokens": 1356597738.0,
"reward": 1.0604492604732514,
"reward_std": 0.14159248620271683,
"rewards/reward_accuracy/mean": 0.9609375,
"rewards/reward_accuracy/std": 0.1394769713282585,
"rewards/reward_format/mean": 0.09951172173023223,
"rewards/reward_format/std": 0.004675122117623687,
"sampling/importance_sampling_ratio/max": 2.48150954246521,
"sampling/importance_sampling_ratio/mean": 0.9958257913589478,
"sampling/importance_sampling_ratio/min": 0.10883653312921523,
"sampling/sampling_logp_difference/max": 1.0503277897834777,
"sampling/sampling_logp_difference/mean": 0.0040012982208281755,
"step": 13770,
"step_time": 7.1043839435064005
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1318.4,
"completions/max_terminated_length": 1093.6,
"completions/mean_length": 157.195703125,
"completions/mean_terminated_length": 146.85506744384764,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.04279208320658654,
"epoch": 29.507494646680943,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0,
"learning_rate": 8.622100000000002e-06,
"loss": -0.0091,
"num_tokens": 1357516335.0,
"reward": 1.0798047304153442,
"reward_std": 0.11617471575737,
"rewards/reward_accuracy/mean": 0.980078125,
"rewards/reward_accuracy/std": 0.1145168460905552,
"rewards/reward_format/mean": 0.09972656518220901,
"rewards/reward_format/std": 0.003159645991399884,
"sampling/importance_sampling_ratio/max": 2.4852007150650026,
"sampling/importance_sampling_ratio/mean": 0.9934064626693726,
"sampling/importance_sampling_ratio/min": 0.13888925006613134,
"sampling/sampling_logp_difference/max": 0.99086434841156,
"sampling/sampling_logp_difference/mean": 0.004128200584091246,
"step": 13780,
"step_time": 6.4625271887955025
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 866.0,
"completions/max_terminated_length": 735.9,
"completions/mean_length": 140.208984375,
"completions/mean_terminated_length": 137.9822570800781,
"completions/min_length": 59.9,
"completions/min_terminated_length": 59.9,
"entropy": 0.035849928134121,
"epoch": 29.528907922912204,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.621100000000001e-06,
"loss": -0.0008,
"num_tokens": 1358394774.0,
"reward": 1.0854882955551148,
"reward_std": 0.07901150435209274,
"rewards/reward_accuracy/mean": 0.985546875,
"rewards/reward_accuracy/std": 0.07868166863918305,
"rewards/reward_format/mean": 0.09994140714406967,
"rewards/reward_format/std": 0.0007535743294283748,
"sampling/importance_sampling_ratio/max": 2.3908814907073976,
"sampling/importance_sampling_ratio/mean": 0.985910701751709,
"sampling/importance_sampling_ratio/min": 0.2024474985897541,
"sampling/sampling_logp_difference/max": 0.9884357213973999,
"sampling/sampling_logp_difference/mean": 0.003706321399658918,
"step": 13790,
"step_time": 4.530505881007412
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1440.8,
"completions/max_terminated_length": 1197.4,
"completions/mean_length": 155.06484375,
"completions/mean_terminated_length": 150.6185333251953,
"completions/min_length": 58.2,
"completions/min_terminated_length": 58.2,
"entropy": 0.03908729809336364,
"epoch": 29.550321199143468,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.365234375,
"learning_rate": 8.6201e-06,
"loss": -0.007,
"num_tokens": 1359312236.0,
"reward": 1.052597665786743,
"reward_std": 0.18439482674002647,
"rewards/reward_accuracy/mean": 0.952734375,
"rewards/reward_accuracy/std": 0.18374130725860596,
"rewards/reward_format/mean": 0.09986328184604645,
"rewards/reward_format/std": 0.002187500172294676,
"sampling/importance_sampling_ratio/max": 2.692543888092041,
"sampling/importance_sampling_ratio/mean": 0.9816253960132599,
"sampling/importance_sampling_ratio/min": 0.11410400867462159,
"sampling/sampling_logp_difference/max": 1.1926552653312683,
"sampling/sampling_logp_difference/mean": 0.004015550622716546,
"step": 13800,
"step_time": 6.826038651997806
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1289.4,
"completions/max_terminated_length": 899.0,
"completions/mean_length": 153.497265625,
"completions/mean_terminated_length": 151.27672729492187,
"completions/min_length": 69.2,
"completions/min_terminated_length": 69.2,
"entropy": 0.03654041574336588,
"epoch": 29.571734475374733,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.06689453125,
"learning_rate": 8.6191e-06,
"loss": -0.006,
"num_tokens": 1360226021.0,
"reward": 1.0679101705551148,
"reward_std": 0.14660519137978553,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.14584104269742965,
"rewards/reward_format/mean": 0.09994140714406967,
"rewards/reward_format/std": 0.0009375000605359674,
"sampling/importance_sampling_ratio/max": 2.5020914316177367,
"sampling/importance_sampling_ratio/mean": 0.9920023560523987,
"sampling/importance_sampling_ratio/min": 0.06675520390272141,
"sampling/sampling_logp_difference/max": 1.1212517201900483,
"sampling/sampling_logp_difference/mean": 0.0037572893081232904,
"step": 13810,
"step_time": 6.108770495987846
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1451.3,
"completions/max_terminated_length": 1092.6,
"completions/mean_length": 165.469921875,
"completions/mean_terminated_length": 151.54563903808594,
"completions/min_length": 72.9,
"completions/min_terminated_length": 72.9,
"entropy": 0.04503370292950422,
"epoch": 29.593147751605997,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.6181e-06,
"loss": -0.0057,
"num_tokens": 1361170744.0,
"reward": 1.0751758098602295,
"reward_std": 0.11372172981500625,
"rewards/reward_accuracy/mean": 0.97578125,
"rewards/reward_accuracy/std": 0.11091147214174271,
"rewards/reward_format/mean": 0.09939453303813935,
"rewards/reward_format/std": 0.004565783077850938,
"sampling/importance_sampling_ratio/max": 2.4393272280693052,
"sampling/importance_sampling_ratio/mean": 0.974408745765686,
"sampling/importance_sampling_ratio/min": 0.029926900565624238,
"sampling/sampling_logp_difference/max": 1.061786061525345,
"sampling/sampling_logp_difference/mean": 0.004202854307368398,
"step": 13820,
"step_time": 7.023514174396405
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1244.7,
"completions/max_terminated_length": 865.7,
"completions/mean_length": 156.915234375,
"completions/mean_terminated_length": 151.725252532959,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.03553216715808958,
"epoch": 29.614561027837258,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.6171875,
"learning_rate": 8.617100000000001e-06,
"loss": -0.0023,
"num_tokens": 1362087967.0,
"reward": 1.0740429878234863,
"reward_std": 0.1188953660428524,
"rewards/reward_accuracy/mean": 0.97421875,
"rewards/reward_accuracy/std": 0.11828143298625945,
"rewards/reward_format/mean": 0.0998242199420929,
"rewards/reward_format/std": 0.0022607231279835106,
"sampling/importance_sampling_ratio/max": 2.433056390285492,
"sampling/importance_sampling_ratio/mean": 0.9734703958034515,
"sampling/importance_sampling_ratio/min": 0.11857563368976116,
"sampling/sampling_logp_difference/max": 0.9761772394180298,
"sampling/sampling_logp_difference/mean": 0.003580527938902378,
"step": 13830,
"step_time": 5.918509610823821
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1037.1,
"completions/max_terminated_length": 829.5,
"completions/mean_length": 140.712890625,
"completions/mean_terminated_length": 138.47177200317384,
"completions/min_length": 62.9,
"completions/min_terminated_length": 62.9,
"entropy": 0.037411584565415976,
"epoch": 29.635974304068522,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.23828125,
"learning_rate": 8.6161e-06,
"loss": -0.0067,
"num_tokens": 1362961536.0,
"reward": 1.0826757967472076,
"reward_std": 0.07531046301592141,
"rewards/reward_accuracy/mean": 0.9828125,
"rewards/reward_accuracy/std": 0.07416215538978577,
"rewards/reward_format/mean": 0.09986328259110451,
"rewards/reward_format/std": 0.0018196488032117485,
"sampling/importance_sampling_ratio/max": 2.434635078907013,
"sampling/importance_sampling_ratio/mean": 0.9927213013172149,
"sampling/importance_sampling_ratio/min": 0.18138984739780425,
"sampling/sampling_logp_difference/max": 0.9953630864620209,
"sampling/sampling_logp_difference/mean": 0.0039002100937068464,
"step": 13840,
"step_time": 5.106325158395339
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 814.8,
"completions/max_terminated_length": 559.4,
"completions/mean_length": 143.81953125,
"completions/mean_terminated_length": 140.8477569580078,
"completions/min_length": 71.7,
"completions/min_terminated_length": 71.7,
"entropy": 0.03221951089799404,
"epoch": 29.657387580299787,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0,
"learning_rate": 8.6151e-06,
"loss": -0.0009,
"num_tokens": 1363845410.0,
"reward": 1.0846484661102296,
"reward_std": 0.09493613764643669,
"rewards/reward_accuracy/mean": 0.984765625,
"rewards/reward_accuracy/std": 0.09382762089371681,
"rewards/reward_format/mean": 0.09988281428813935,
"rewards/reward_format/std": 0.0015071487054228784,
"sampling/importance_sampling_ratio/max": 2.320539891719818,
"sampling/importance_sampling_ratio/mean": 0.9829268217086792,
"sampling/importance_sampling_ratio/min": 0.15675504505634308,
"sampling/sampling_logp_difference/max": 0.9643440008163452,
"sampling/sampling_logp_difference/mean": 0.0034470703219994904,
"step": 13850,
"step_time": 4.210993354400853
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 922.6,
"completions/max_terminated_length": 835.1,
"completions/mean_length": 143.306640625,
"completions/mean_terminated_length": 140.34449462890626,
"completions/min_length": 66.3,
"completions/min_terminated_length": 66.3,
"entropy": 0.03469389732927084,
"epoch": 29.678800856531048,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.1953125,
"learning_rate": 8.614100000000001e-06,
"loss": -0.0009,
"num_tokens": 1364727091.0,
"reward": 1.061582052707672,
"reward_std": 0.15299849361181259,
"rewards/reward_accuracy/mean": 0.96171875,
"rewards/reward_accuracy/std": 0.15243870317935942,
"rewards/reward_format/mean": 0.09986328259110451,
"rewards/reward_format/std": 0.0018196487100794912,
"sampling/importance_sampling_ratio/max": 2.548158860206604,
"sampling/importance_sampling_ratio/mean": 0.9914948284626007,
"sampling/importance_sampling_ratio/min": 0.16924354210495948,
"sampling/sampling_logp_difference/max": 0.9998377084732055,
"sampling/sampling_logp_difference/mean": 0.003750290279276669,
"step": 13860,
"step_time": 4.721280092684902
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1518.5,
"completions/max_terminated_length": 1178.2,
"completions/mean_length": 163.95859375,
"completions/mean_terminated_length": 150.6374038696289,
"completions/min_length": 62.4,
"completions/min_terminated_length": 62.4,
"entropy": 0.04255421543493867,
"epoch": 29.700214132762312,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0,
"learning_rate": 8.6131e-06,
"loss": -0.0044,
"num_tokens": 1365665033.0,
"reward": 1.0670117437839508,
"reward_std": 0.13238815665245057,
"rewards/reward_accuracy/mean": 0.967578125,
"rewards/reward_accuracy/std": 0.1294404074549675,
"rewards/reward_format/mean": 0.09943359568715096,
"rewards/reward_format/std": 0.0052816096926108,
"sampling/importance_sampling_ratio/max": 2.5598702430725098,
"sampling/importance_sampling_ratio/mean": 0.9820736348628998,
"sampling/importance_sampling_ratio/min": 0.0502091963775456,
"sampling/sampling_logp_difference/max": 1.0061869025230408,
"sampling/sampling_logp_difference/mean": 0.004167274129576981,
"step": 13870,
"step_time": 7.314270482506254
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 836.1,
"completions/max_terminated_length": 816.5,
"completions/mean_length": 152.337890625,
"completions/mean_terminated_length": 150.21431579589844,
"completions/min_length": 68.4,
"completions/min_terminated_length": 68.4,
"entropy": 0.03529180029872805,
"epoch": 29.721627408993577,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.1875,
"learning_rate": 8.612100000000002e-06,
"loss": -0.0026,
"num_tokens": 1366570186.0,
"reward": 1.059648460149765,
"reward_std": 0.14474062919616698,
"rewards/reward_accuracy/mean": 0.959765625,
"rewards/reward_accuracy/std": 0.14448220133781434,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.0010782782919704914,
"sampling/importance_sampling_ratio/max": 2.3530782222747804,
"sampling/importance_sampling_ratio/mean": 0.9870111525058747,
"sampling/importance_sampling_ratio/min": 0.20290366411209107,
"sampling/sampling_logp_difference/max": 0.9032480597496033,
"sampling/sampling_logp_difference/mean": 0.0037497363984584807,
"step": 13880,
"step_time": 4.279399681396899
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1362.8,
"completions/max_terminated_length": 1005.4,
"completions/mean_length": 159.2375,
"completions/mean_terminated_length": 153.366162109375,
"completions/min_length": 67.9,
"completions/min_terminated_length": 67.9,
"entropy": 0.040637762588448825,
"epoch": 29.74304068522484,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.0,
"learning_rate": 8.611100000000001e-06,
"loss": -0.0081,
"num_tokens": 1367492906.0,
"reward": 1.0591406404972077,
"reward_std": 0.15913919880986213,
"rewards/reward_accuracy/mean": 0.959375,
"rewards/reward_accuracy/std": 0.15759406089782715,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.003142323181964457,
"sampling/importance_sampling_ratio/max": 2.4714740753173827,
"sampling/importance_sampling_ratio/mean": 0.9847789168357849,
"sampling/importance_sampling_ratio/min": 0.15087331235408782,
"sampling/sampling_logp_difference/max": 0.9040522098541259,
"sampling/sampling_logp_difference/mean": 0.00400087651796639,
"step": 13890,
"step_time": 6.675752812504652
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1039.8,
"completions/max_terminated_length": 854.9,
"completions/mean_length": 144.226953125,
"completions/mean_terminated_length": 140.5423156738281,
"completions/min_length": 62.3,
"completions/min_terminated_length": 62.3,
"entropy": 0.03443942710291594,
"epoch": 29.764453961456102,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.1240234375,
"learning_rate": 8.6101e-06,
"loss": -0.0089,
"num_tokens": 1368378495.0,
"reward": 1.0752734541893005,
"reward_std": 0.12233409881591797,
"rewards/reward_accuracy/mean": 0.975390625,
"rewards/reward_accuracy/std": 0.12126294746994973,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.0015071486588567496,
"sampling/importance_sampling_ratio/max": 2.3296689867973326,
"sampling/importance_sampling_ratio/mean": 0.9885314226150512,
"sampling/importance_sampling_ratio/min": 0.08610992282629013,
"sampling/sampling_logp_difference/max": 0.942397129535675,
"sampling/sampling_logp_difference/mean": 0.0036117164883762596,
"step": 13900,
"step_time": 5.325863478888641
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1100.2,
"completions/max_terminated_length": 1079.4,
"completions/mean_length": 152.4640625,
"completions/mean_terminated_length": 151.00467987060546,
"completions/min_length": 68.1,
"completions/min_terminated_length": 68.1,
"entropy": 0.03950352752581239,
"epoch": 29.785867237687366,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.3359375,
"learning_rate": 8.6091e-06,
"loss": 0.0012,
"num_tokens": 1369288099.0,
"reward": 1.088964855670929,
"reward_std": 0.06977556198835373,
"rewards/reward_accuracy/mean": 0.9890625,
"rewards/reward_accuracy/std": 0.06940531507134437,
"rewards/reward_format/mean": 0.09990234449505805,
"rewards/reward_format/std": 0.0013226743321865797,
"sampling/importance_sampling_ratio/max": 2.565922474861145,
"sampling/importance_sampling_ratio/mean": 0.991613632440567,
"sampling/importance_sampling_ratio/min": 0.10025463700294494,
"sampling/sampling_logp_difference/max": 1.0150130987167358,
"sampling/sampling_logp_difference/mean": 0.003933209157548845,
"step": 13910,
"step_time": 5.46372547117935
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1450.7,
"completions/max_terminated_length": 1211.3,
"completions/mean_length": 182.080859375,
"completions/mean_terminated_length": 161.7768127441406,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.04720613935496658,
"epoch": 29.80728051391863,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.6081e-06,
"loss": -0.0055,
"num_tokens": 1370279586.0,
"reward": 1.0658984541893006,
"reward_std": 0.13938942924141884,
"rewards/reward_accuracy/mean": 0.966796875,
"rewards/reward_accuracy/std": 0.13582222610712053,
"rewards/reward_format/mean": 0.09910156279802322,
"rewards/reward_format/std": 0.0066646986408159135,
"sampling/importance_sampling_ratio/max": 2.4257188200950623,
"sampling/importance_sampling_ratio/mean": 0.9854755938053131,
"sampling/importance_sampling_ratio/min": 0.06195857785642147,
"sampling/sampling_logp_difference/max": 1.0547230541706085,
"sampling/sampling_logp_difference/mean": 0.004000648320652544,
"step": 13920,
"step_time": 7.365357142503489
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1747.7,
"completions/max_terminated_length": 1327.0,
"completions/mean_length": 183.973828125,
"completions/mean_terminated_length": 165.77772827148436,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.04807126496452838,
"epoch": 29.82869379014989,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.412109375,
"learning_rate": 8.607100000000001e-06,
"loss": -0.005,
"num_tokens": 1371273455.0,
"reward": 1.043750023841858,
"reward_std": 0.19735948741436005,
"rewards/reward_accuracy/mean": 0.94453125,
"rewards/reward_accuracy/std": 0.19494493156671525,
"rewards/reward_format/mean": 0.09921875149011612,
"rewards/reward_format/std": 0.0051782091846689585,
"sampling/importance_sampling_ratio/max": 2.581442713737488,
"sampling/importance_sampling_ratio/mean": 0.9834695518016815,
"sampling/importance_sampling_ratio/min": 0.03667011111974716,
"sampling/sampling_logp_difference/max": 1.305296528339386,
"sampling/sampling_logp_difference/mean": 0.004197004553861916,
"step": 13930,
"step_time": 8.489862579799956
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1689.2,
"completions/max_terminated_length": 1524.4,
"completions/mean_length": 158.8515625,
"completions/mean_terminated_length": 152.22531127929688,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.042860653321258727,
"epoch": 29.850107066381156,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.443359375,
"learning_rate": 8.6061e-06,
"loss": -0.0099,
"num_tokens": 1372194963.0,
"reward": 1.0774804830551148,
"reward_std": 0.11626238971948624,
"rewards/reward_accuracy/mean": 0.977734375,
"rewards/reward_accuracy/std": 0.11512843519449234,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.002635794528760016,
"sampling/importance_sampling_ratio/max": 2.4503477215766907,
"sampling/importance_sampling_ratio/mean": 0.9894273042678833,
"sampling/importance_sampling_ratio/min": 0.10578839145600796,
"sampling/sampling_logp_difference/max": 0.9848827362060547,
"sampling/sampling_logp_difference/mean": 0.0041358743095770475,
"step": 13940,
"step_time": 7.96898280690948
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 964.2,
"completions/max_terminated_length": 778.7,
"completions/mean_length": 151.875390625,
"completions/mean_terminated_length": 146.74038696289062,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.03673561993055045,
"epoch": 29.87152034261242,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.228515625,
"learning_rate": 8.6051e-06,
"loss": -0.0035,
"num_tokens": 1373103396.0,
"reward": 1.0752344012260437,
"reward_std": 0.11313083842396736,
"rewards/reward_accuracy/mean": 0.975390625,
"rewards/reward_accuracy/std": 0.112538281083107,
"rewards/reward_format/mean": 0.09984375163912773,
"rewards/reward_format/std": 0.0012426253408193589,
"sampling/importance_sampling_ratio/max": 2.5059892177581786,
"sampling/importance_sampling_ratio/mean": 0.9942259967327118,
"sampling/importance_sampling_ratio/min": 0.17677710354328155,
"sampling/sampling_logp_difference/max": 0.9959556818008423,
"sampling/sampling_logp_difference/mean": 0.003855749382637441,
"step": 13950,
"step_time": 4.9719719339133
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.9179875582485693e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.9179875582485693e-06,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1304.8,
"completions/max_terminated_length": 1174.2,
"completions/mean_length": 180.8609375,
"completions/mean_terminated_length": 163.6429412841797,
"completions/min_length": 66.4,
"completions/min_terminated_length": 66.4,
"entropy": 0.048564502689987424,
"epoch": 29.89293361884368,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.07763671875,
"learning_rate": 8.604100000000001e-06,
"loss": 0.001,
"num_tokens": 1374086016.0,
"reward": 1.0571093916893006,
"reward_std": 0.17092895731329918,
"rewards/reward_accuracy/mean": 0.9578125,
"rewards/reward_accuracy/std": 0.1689176708459854,
"rewards/reward_format/mean": 0.09929687604308128,
"rewards/reward_format/std": 0.004173422581516206,
"sampling/importance_sampling_ratio/max": 2.427391302585602,
"sampling/importance_sampling_ratio/mean": 0.9912963271141052,
"sampling/importance_sampling_ratio/min": 0.07453354671597481,
"sampling/sampling_logp_difference/max": 1.167798388004303,
"sampling/sampling_logp_difference/mean": 0.004209204600192607,
"step": 13960,
"step_time": 6.6350509376876285
},
{
"clip_ratio/high_max": 3.357028435857501e-05,
"clip_ratio/high_mean": 4.196285544821876e-06,
"clip_ratio/low_mean": 5.146197395333729e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 9.342482940155605e-06,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 982.0,
"completions/max_terminated_length": 693.0,
"completions/mean_length": 153.7484375,
"completions/mean_terminated_length": 141.9353057861328,
"completions/min_length": 68.5,
"completions/min_terminated_length": 68.5,
"entropy": 0.03756462312303484,
"epoch": 29.914346895074946,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.05908203125,
"learning_rate": 8.6031e-06,
"loss": -0.0048,
"num_tokens": 1374997964.0,
"reward": 1.068046897649765,
"reward_std": 0.13081349804997444,
"rewards/reward_accuracy/mean": 0.968359375,
"rewards/reward_accuracy/std": 0.12926168441772462,
"rewards/reward_format/mean": 0.09968750104308129,
"rewards/reward_format/std": 0.0024822523118928075,
"sampling/importance_sampling_ratio/max": 2.487934136390686,
"sampling/importance_sampling_ratio/mean": 0.9816307187080383,
"sampling/importance_sampling_ratio/min": 0.11752406507730484,
"sampling/sampling_logp_difference/max": 0.9825291156768798,
"sampling/sampling_logp_difference/mean": 0.003773762448690832,
"step": 13970,
"step_time": 5.074303537697415
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1202.3,
"completions/max_terminated_length": 988.6,
"completions/mean_length": 146.57421875,
"completions/mean_terminated_length": 142.87630615234374,
"completions/min_length": 61.7,
"completions/min_terminated_length": 61.7,
"entropy": 0.03802272372413427,
"epoch": 29.93576017130621,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.80078125,
"learning_rate": 8.6021e-06,
"loss": 0.0018,
"num_tokens": 1375893418.0,
"reward": 1.0814844012260436,
"reward_std": 0.09730511307716369,
"rewards/reward_accuracy/mean": 0.981640625,
"rewards/reward_accuracy/std": 0.0965939611196518,
"rewards/reward_format/mean": 0.09984375163912773,
"rewards/reward_format/std": 0.0019482230301946402,
"sampling/importance_sampling_ratio/max": 2.3463871717453,
"sampling/importance_sampling_ratio/mean": 1.0017538487911224,
"sampling/importance_sampling_ratio/min": 0.12595587968826294,
"sampling/sampling_logp_difference/max": 0.9263225078582764,
"sampling/sampling_logp_difference/mean": 0.00393057968467474,
"step": 13980,
"step_time": 5.71723354961141
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.0550956403676537e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.0550956403676537e-06,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1514.2,
"completions/max_terminated_length": 1402.6,
"completions/mean_length": 165.369140625,
"completions/mean_terminated_length": 151.35939025878906,
"completions/min_length": 62.0,
"completions/min_terminated_length": 62.0,
"entropy": 0.04469506368041039,
"epoch": 29.957173447537475,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.29296875,
"learning_rate": 8.601100000000001e-06,
"loss": -0.0104,
"num_tokens": 1376839659.0,
"reward": 1.080625021457672,
"reward_std": 0.11276706010103225,
"rewards/reward_accuracy/mean": 0.98125,
"rewards/reward_accuracy/std": 0.1096247337758541,
"rewards/reward_format/mean": 0.09937500134110451,
"rewards/reward_format/std": 0.004388956585898995,
"sampling/importance_sampling_ratio/max": 2.680487108230591,
"sampling/importance_sampling_ratio/mean": 0.9837688207626343,
"sampling/importance_sampling_ratio/min": 0.09483756422996521,
"sampling/sampling_logp_difference/max": 1.1869612276554107,
"sampling/sampling_logp_difference/mean": 0.004176798393018544,
"step": 13990,
"step_time": 7.442111324207508
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1313.0,
"completions/max_terminated_length": 1176.9,
"completions/mean_length": 165.566015625,
"completions/mean_terminated_length": 153.13983612060548,
"completions/min_length": 69.2,
"completions/min_terminated_length": 69.2,
"entropy": 0.04118067636154592,
"epoch": 29.978586723768736,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.2373046875,
"learning_rate": 8.600100000000001e-06,
"loss": -0.0063,
"num_tokens": 1377786068.0,
"reward": 1.072519552707672,
"reward_std": 0.13436340987682344,
"rewards/reward_accuracy/mean": 0.973046875,
"rewards/reward_accuracy/std": 0.1320886418223381,
"rewards/reward_format/mean": 0.0994726575911045,
"rewards/reward_format/std": 0.004553568991832435,
"sampling/importance_sampling_ratio/max": 2.4721694946289063,
"sampling/importance_sampling_ratio/mean": 0.9936583817005158,
"sampling/importance_sampling_ratio/min": 0.09542231485247613,
"sampling/sampling_logp_difference/max": 1.068565058708191,
"sampling/sampling_logp_difference/mean": 0.003918576799333095,
"step": 14000,
"step_time": 6.759984489303315
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 998.3,
"completions/max_terminated_length": 704.4,
"completions/mean_length": 145.9015625,
"completions/mean_terminated_length": 144.40902099609374,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.03674996355548501,
"epoch": 30.0,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0,
"learning_rate": 8.5991e-06,
"loss": -0.0027,
"num_tokens": 1378675176.0,
"reward": 1.0722070455551147,
"reward_std": 0.12313387393951417,
"rewards/reward_accuracy/mean": 0.972265625,
"rewards/reward_accuracy/std": 0.12256295755505561,
"rewards/reward_format/mean": 0.09994140714406967,
"rewards/reward_format/std": 0.0009375000605359674,
"sampling/importance_sampling_ratio/max": 2.395489513874054,
"sampling/importance_sampling_ratio/mean": 0.9945017576217652,
"sampling/importance_sampling_ratio/min": 0.1409907028079033,
"sampling/sampling_logp_difference/max": 1.3138140916824341,
"sampling/sampling_logp_difference/mean": 0.0037602039985358713,
"step": 14010,
"step_time": 4.85200586328574
},
{
"clip_ratio/high_max": 1.4678252045996488e-05,
"clip_ratio/high_mean": 1.834781505749561e-06,
"clip_ratio/low_mean": 2.6179592168773525e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.4527407226269135e-06,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1156.5,
"completions/max_terminated_length": 613.2,
"completions/mean_length": 154.123828125,
"completions/mean_terminated_length": 137.1219253540039,
"completions/min_length": 62.6,
"completions/min_terminated_length": 62.6,
"entropy": 0.03649476072750986,
"epoch": 30.021413276231264,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.5981e-06,
"loss": -0.0029,
"num_tokens": 1379590661.0,
"reward": 1.0656445503234864,
"reward_std": 0.14455204978585243,
"rewards/reward_accuracy/mean": 0.96640625,
"rewards/reward_accuracy/std": 0.141041848808527,
"rewards/reward_format/mean": 0.0992382824420929,
"rewards/reward_format/std": 0.004728732071816922,
"sampling/importance_sampling_ratio/max": 2.3962196350097655,
"sampling/importance_sampling_ratio/mean": 0.9939972579479217,
"sampling/importance_sampling_ratio/min": 0.21644495725631713,
"sampling/sampling_logp_difference/max": 0.9061021387577057,
"sampling/sampling_logp_difference/mean": 0.0037045964039862157,
"step": 14020,
"step_time": 5.901907270704396
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1001.1,
"completions/max_terminated_length": 844.0,
"completions/mean_length": 147.26640625,
"completions/mean_terminated_length": 139.14141235351562,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.03616379899904132,
"epoch": 30.042826552462525,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.43359375,
"learning_rate": 8.597100000000001e-06,
"loss": -0.0029,
"num_tokens": 1380481631.0,
"reward": 1.065195333957672,
"reward_std": 0.14904991164803505,
"rewards/reward_accuracy/mean": 0.965625,
"rewards/reward_accuracy/std": 0.14696751460433005,
"rewards/reward_format/mean": 0.09957031384110451,
"rewards/reward_format/std": 0.0025662324391305447,
"sampling/importance_sampling_ratio/max": 2.335717189311981,
"sampling/importance_sampling_ratio/mean": 0.9793357670307159,
"sampling/importance_sampling_ratio/min": 0.13418220742605627,
"sampling/sampling_logp_difference/max": 1.3550223410129547,
"sampling/sampling_logp_difference/mean": 0.003952082362957299,
"step": 14030,
"step_time": 5.019115884506027
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1263.2,
"completions/max_terminated_length": 1187.4,
"completions/mean_length": 159.663671875,
"completions/mean_terminated_length": 155.35486755371093,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.04014863681513816,
"epoch": 30.06423982869379,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0,
"learning_rate": 8.5961e-06,
"loss": -0.0005,
"num_tokens": 1381416050.0,
"reward": 1.0627148389816283,
"reward_std": 0.13998157232999803,
"rewards/reward_accuracy/mean": 0.962890625,
"rewards/reward_accuracy/std": 0.1391410320997238,
"rewards/reward_format/mean": 0.09982421845197678,
"rewards/reward_format/std": 0.0021842263638973238,
"sampling/importance_sampling_ratio/max": 2.4477888703346253,
"sampling/importance_sampling_ratio/mean": 0.985552716255188,
"sampling/importance_sampling_ratio/min": 0.0701983296778053,
"sampling/sampling_logp_difference/max": 1.0176236629486084,
"sampling/sampling_logp_difference/mean": 0.003991411393508315,
"step": 14040,
"step_time": 6.122020601696567
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1294.5,
"completions/max_terminated_length": 1133.1,
"completions/mean_length": 148.184375,
"completions/mean_terminated_length": 142.3123550415039,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.03975590779446066,
"epoch": 30.085653104925054,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.23046875,
"learning_rate": 8.5951e-06,
"loss": -0.0056,
"num_tokens": 1382312266.0,
"reward": 1.0517187714576721,
"reward_std": 0.17840798199176788,
"rewards/reward_accuracy/mean": 0.951953125,
"rewards/reward_accuracy/std": 0.17769744396209716,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0021712252171710135,
"sampling/importance_sampling_ratio/max": 2.5417781829833985,
"sampling/importance_sampling_ratio/mean": 0.9955795109272003,
"sampling/importance_sampling_ratio/min": 0.1008726954460144,
"sampling/sampling_logp_difference/max": 1.1477097630500794,
"sampling/sampling_logp_difference/mean": 0.003937347163446248,
"step": 14050,
"step_time": 6.325891975895502
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 982.5,
"completions/max_terminated_length": 862.0,
"completions/mean_length": 161.65625,
"completions/mean_terminated_length": 152.9273208618164,
"completions/min_length": 65.6,
"completions/min_terminated_length": 65.6,
"entropy": 0.03755353898741305,
"epoch": 30.10706638115632,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.594100000000001e-06,
"loss": -0.0066,
"num_tokens": 1383249498.0,
"reward": 1.0746484637260436,
"reward_std": 0.10707046792376787,
"rewards/reward_accuracy/mean": 0.975,
"rewards/reward_accuracy/std": 0.10481263026595115,
"rewards/reward_format/mean": 0.09964843913912773,
"rewards/reward_format/std": 0.0032598919468000533,
"sampling/importance_sampling_ratio/max": 2.5738895654678347,
"sampling/importance_sampling_ratio/mean": 0.9917259812355042,
"sampling/importance_sampling_ratio/min": 0.1264908045530319,
"sampling/sampling_logp_difference/max": 1.0110350728034974,
"sampling/sampling_logp_difference/mean": 0.003768993401899934,
"step": 14060,
"step_time": 5.0038396617863325
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1265.8,
"completions/max_terminated_length": 812.2,
"completions/mean_length": 161.7203125,
"completions/mean_terminated_length": 149.99980773925782,
"completions/min_length": 65.7,
"completions/min_terminated_length": 65.7,
"entropy": 0.039790943777188656,
"epoch": 30.12847965738758,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.5931e-06,
"loss": -0.0039,
"num_tokens": 1384187998.0,
"reward": 1.080468761920929,
"reward_std": 0.09731297641992569,
"rewards/reward_accuracy/mean": 0.980859375,
"rewards/reward_accuracy/std": 0.09462623223662377,
"rewards/reward_format/mean": 0.09960937574505806,
"rewards/reward_format/std": 0.004018527106381953,
"sampling/importance_sampling_ratio/max": 2.486131119728088,
"sampling/importance_sampling_ratio/mean": 0.9849616229534149,
"sampling/importance_sampling_ratio/min": 0.12668245229870082,
"sampling/sampling_logp_difference/max": 1.2733551144599915,
"sampling/sampling_logp_difference/mean": 0.0038890611845999955,
"step": 14070,
"step_time": 6.433577680992312
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1028.2,
"completions/max_terminated_length": 911.6,
"completions/mean_length": 157.18671875,
"completions/mean_terminated_length": 146.875146484375,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.04023089401889592,
"epoch": 30.149892933618844,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.1982421875,
"learning_rate": 8.5921e-06,
"loss": -0.0033,
"num_tokens": 1385107148.0,
"reward": 1.0839843988418578,
"reward_std": 0.08052003756165504,
"rewards/reward_accuracy/mean": 0.984375,
"rewards/reward_accuracy/std": 0.07895710244774819,
"rewards/reward_format/mean": 0.09960937574505806,
"rewards/reward_format/std": 0.002983086928725243,
"sampling/importance_sampling_ratio/max": 2.431064188480377,
"sampling/importance_sampling_ratio/mean": 0.9954243302345276,
"sampling/importance_sampling_ratio/min": 0.13557093935087322,
"sampling/sampling_logp_difference/max": 0.9201222062110901,
"sampling/sampling_logp_difference/mean": 0.0036937000462785364,
"step": 14080,
"step_time": 5.357477844497771
},
{
"clip_ratio/high_max": 1.6979081556200982e-05,
"clip_ratio/high_mean": 2.122385194525123e-06,
"clip_ratio/low_mean": 3.652407713161665e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.487625965841289e-06,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1507.3,
"completions/max_terminated_length": 1084.0,
"completions/mean_length": 157.34765625,
"completions/mean_terminated_length": 144.2251434326172,
"completions/min_length": 65.6,
"completions/min_terminated_length": 65.6,
"entropy": 0.04376526079140604,
"epoch": 30.17130620985011,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0478515625,
"learning_rate": 8.591100000000001e-06,
"loss": -0.0029,
"num_tokens": 1386028470.0,
"reward": 1.0650000154972077,
"reward_std": 0.13704145327210426,
"rewards/reward_accuracy/mean": 0.965625,
"rewards/reward_accuracy/std": 0.1341216430068016,
"rewards/reward_format/mean": 0.09937500134110451,
"rewards/reward_format/std": 0.005139377177692949,
"sampling/importance_sampling_ratio/max": 2.5779218673706055,
"sampling/importance_sampling_ratio/mean": 0.9910317301750183,
"sampling/importance_sampling_ratio/min": 0.0852734487503767,
"sampling/sampling_logp_difference/max": 1.0184229731559753,
"sampling/sampling_logp_difference/mean": 0.004162764083594084,
"step": 14090,
"step_time": 7.288845029807999
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 914.1,
"completions/max_terminated_length": 807.7,
"completions/mean_length": 143.546875,
"completions/mean_terminated_length": 138.3842330932617,
"completions/min_length": 62.5,
"completions/min_terminated_length": 62.5,
"entropy": 0.03365111204329878,
"epoch": 30.19271948608137,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.267578125,
"learning_rate": 8.590100000000001e-06,
"loss": 0.0004,
"num_tokens": 1386906446.0,
"reward": 1.0779883146286011,
"reward_std": 0.10466228723526001,
"rewards/reward_accuracy/mean": 0.978125,
"rewards/reward_accuracy/std": 0.10409004241228104,
"rewards/reward_format/mean": 0.09986328333616257,
"rewards/reward_format/std": 0.0014212878420948982,
"sampling/importance_sampling_ratio/max": 2.512523889541626,
"sampling/importance_sampling_ratio/mean": 0.9987329959869384,
"sampling/importance_sampling_ratio/min": 0.1361880786716938,
"sampling/sampling_logp_difference/max": 1.086052918434143,
"sampling/sampling_logp_difference/mean": 0.003792333509773016,
"step": 14100,
"step_time": 4.615956640202785
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1211.7,
"completions/max_terminated_length": 910.2,
"completions/mean_length": 153.987890625,
"completions/mean_terminated_length": 148.85083923339843,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.03975742999464273,
"epoch": 30.214132762312634,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.33203125,
"learning_rate": 8.5891e-06,
"loss": -0.0039,
"num_tokens": 1387812143.0,
"reward": 1.078398460149765,
"reward_std": 0.1018158607184887,
"rewards/reward_accuracy/mean": 0.978515625,
"rewards/reward_accuracy/std": 0.10148641094565392,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.0009831610135734082,
"sampling/importance_sampling_ratio/max": 2.233919322490692,
"sampling/importance_sampling_ratio/mean": 0.9837686598300934,
"sampling/importance_sampling_ratio/min": 0.06114758551120758,
"sampling/sampling_logp_difference/max": 1.045470905303955,
"sampling/sampling_logp_difference/mean": 0.0039591020438820125,
"step": 14110,
"step_time": 5.947359301292454
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 616.9,
"completions/max_terminated_length": 439.7,
"completions/mean_length": 133.855078125,
"completions/mean_terminated_length": 130.89073638916017,
"completions/min_length": 62.3,
"completions/min_terminated_length": 62.3,
"entropy": 0.03202334854286164,
"epoch": 30.235546038543898,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.0,
"learning_rate": 8.5881e-06,
"loss": 0.0038,
"num_tokens": 1388672540.0,
"reward": 1.0717968940734863,
"reward_std": 0.10824903398752213,
"rewards/reward_accuracy/mean": 0.971875,
"rewards/reward_accuracy/std": 0.10795819610357285,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.0012500001117587089,
"sampling/importance_sampling_ratio/max": 2.4080016255378722,
"sampling/importance_sampling_ratio/mean": 0.985862010717392,
"sampling/importance_sampling_ratio/min": 0.18820060417056084,
"sampling/sampling_logp_difference/max": 0.9993961870670318,
"sampling/sampling_logp_difference/mean": 0.003588234889321029,
"step": 14120,
"step_time": 3.40057106911554
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1498.7,
"completions/max_terminated_length": 1237.3,
"completions/mean_length": 160.77109375,
"completions/mean_terminated_length": 152.68561706542968,
"completions/min_length": 67.2,
"completions/min_terminated_length": 67.2,
"entropy": 0.04354093507863581,
"epoch": 30.25695931477516,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.208984375,
"learning_rate": 8.587100000000001e-06,
"loss": -0.0071,
"num_tokens": 1389604962.0,
"reward": 1.0567773699760437,
"reward_std": 0.17934232726693153,
"rewards/reward_accuracy/mean": 0.95703125,
"rewards/reward_accuracy/std": 0.17844132259488105,
"rewards/reward_format/mean": 0.09974609538912774,
"rewards/reward_format/std": 0.0027787382947281,
"sampling/importance_sampling_ratio/max": 2.4927259922027587,
"sampling/importance_sampling_ratio/mean": 0.9866882145404816,
"sampling/importance_sampling_ratio/min": 0.08946277459617705,
"sampling/sampling_logp_difference/max": 1.080164861679077,
"sampling/sampling_logp_difference/mean": 0.004032064857892692,
"step": 14130,
"step_time": 7.463042471485096
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1459.5,
"completions/max_terminated_length": 1253.9,
"completions/mean_length": 167.185546875,
"completions/mean_terminated_length": 156.9773696899414,
"completions/min_length": 67.9,
"completions/min_terminated_length": 67.9,
"entropy": 0.03910287707112729,
"epoch": 30.278372591006423,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 8.5861e-06,
"loss": -0.0067,
"num_tokens": 1390556941.0,
"reward": 1.0593359470367432,
"reward_std": 0.17576649263501168,
"rewards/reward_accuracy/mean": 0.959765625,
"rewards/reward_accuracy/std": 0.17410222589969634,
"rewards/reward_format/mean": 0.09957031309604644,
"rewards/reward_format/std": 0.003938051778823138,
"sampling/importance_sampling_ratio/max": 2.4389252066612244,
"sampling/importance_sampling_ratio/mean": 0.9879510045051575,
"sampling/importance_sampling_ratio/min": 0.12008569613099099,
"sampling/sampling_logp_difference/max": 0.9898298263549805,
"sampling/sampling_logp_difference/mean": 0.003645697166211903,
"step": 14140,
"step_time": 7.139663910819218
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1163.1,
"completions/max_terminated_length": 1096.3,
"completions/mean_length": 158.545703125,
"completions/mean_terminated_length": 151.956494140625,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.040178249962627886,
"epoch": 30.299785867237688,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.1865234375,
"learning_rate": 8.5851e-06,
"loss": -0.0044,
"num_tokens": 1391475154.0,
"reward": 1.0504297077655793,
"reward_std": 0.17119412869215012,
"rewards/reward_accuracy/mean": 0.95078125,
"rewards/reward_accuracy/std": 0.16949974969029427,
"rewards/reward_format/mean": 0.09964843764901161,
"rewards/reward_format/std": 0.003308165562339127,
"sampling/importance_sampling_ratio/max": 2.479168510437012,
"sampling/importance_sampling_ratio/mean": 0.9900160431861877,
"sampling/importance_sampling_ratio/min": 0.13665448427200316,
"sampling/sampling_logp_difference/max": 0.9801332294940949,
"sampling/sampling_logp_difference/mean": 0.0038382807048037647,
"step": 14150,
"step_time": 5.977336377796019
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1265.4,
"completions/max_terminated_length": 986.2,
"completions/mean_length": 158.7890625,
"completions/mean_terminated_length": 150.75342254638673,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.041062525333836676,
"epoch": 30.321199143468952,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.584100000000001e-06,
"loss": -0.0049,
"num_tokens": 1392401622.0,
"reward": 1.0853320360183716,
"reward_std": 0.09095664471387863,
"rewards/reward_accuracy/mean": 0.985546875,
"rewards/reward_accuracy/std": 0.0894832193851471,
"rewards/reward_format/mean": 0.09978515803813934,
"rewards/reward_format/std": 0.002272926946170628,
"sampling/importance_sampling_ratio/max": 2.3569497585296633,
"sampling/importance_sampling_ratio/mean": 0.9750773966312408,
"sampling/importance_sampling_ratio/min": 0.10637500584125519,
"sampling/sampling_logp_difference/max": 1.1215860366821289,
"sampling/sampling_logp_difference/mean": 0.00412395759485662,
"step": 14160,
"step_time": 6.33649731882615
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1294.3,
"completions/max_terminated_length": 1154.7,
"completions/mean_length": 154.822265625,
"completions/mean_terminated_length": 146.72684020996093,
"completions/min_length": 63.2,
"completions/min_terminated_length": 63.2,
"entropy": 0.03649824373424053,
"epoch": 30.342612419700213,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.1923828125,
"learning_rate": 8.583100000000001e-06,
"loss": -0.0066,
"num_tokens": 1393321503.0,
"reward": 1.0829492330551147,
"reward_std": 0.09937904179096221,
"rewards/reward_accuracy/mean": 0.983203125,
"rewards/reward_accuracy/std": 0.09823757782578468,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.002373939217068255,
"sampling/importance_sampling_ratio/max": 2.386985456943512,
"sampling/importance_sampling_ratio/mean": 0.9873851120471955,
"sampling/importance_sampling_ratio/min": 0.14734703116118908,
"sampling/sampling_logp_difference/max": 1.0329522252082826,
"sampling/sampling_logp_difference/mean": 0.003707513236440718,
"step": 14170,
"step_time": 6.398856163091841
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1527.2,
"completions/max_terminated_length": 1125.7,
"completions/mean_length": 161.64453125,
"completions/mean_terminated_length": 152.03629455566406,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.03915217409376055,
"epoch": 30.364025695931478,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.0,
"learning_rate": 8.5821e-06,
"loss": -0.006,
"num_tokens": 1394260161.0,
"reward": 1.067636740207672,
"reward_std": 0.14877479374408722,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.14724834710359574,
"rewards/reward_format/mean": 0.09966796934604645,
"rewards/reward_format/std": 0.0033841135445982218,
"sampling/importance_sampling_ratio/max": 2.294904100894928,
"sampling/importance_sampling_ratio/mean": 0.9776871979236603,
"sampling/importance_sampling_ratio/min": 0.11920144874602556,
"sampling/sampling_logp_difference/max": 0.9993861556053162,
"sampling/sampling_logp_difference/mean": 0.0037739319959655404,
"step": 14180,
"step_time": 7.322312445106218
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1072.0,
"completions/max_terminated_length": 880.8,
"completions/mean_length": 153.114453125,
"completions/mean_terminated_length": 143.58091583251954,
"completions/min_length": 62.1,
"completions/min_terminated_length": 62.1,
"entropy": 0.03818146868143231,
"epoch": 30.385438972162742,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.416015625,
"learning_rate": 8.581100000000002e-06,
"loss": -0.0034,
"num_tokens": 1395169174.0,
"reward": 1.0863476634025573,
"reward_std": 0.08301939442753792,
"rewards/reward_accuracy/mean": 0.98671875,
"rewards/reward_accuracy/std": 0.08075315952301025,
"rewards/reward_format/mean": 0.09962890669703484,
"rewards/reward_format/std": 0.002921417448669672,
"sampling/importance_sampling_ratio/max": 2.4285526275634766,
"sampling/importance_sampling_ratio/mean": 0.9740017712116241,
"sampling/importance_sampling_ratio/min": 0.028017663210630418,
"sampling/sampling_logp_difference/max": 1.0469399213790893,
"sampling/sampling_logp_difference/mean": 0.0038284634705632926,
"step": 14190,
"step_time": 5.541599258090718
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 942.2,
"completions/max_terminated_length": 768.2,
"completions/mean_length": 134.424609375,
"completions/mean_terminated_length": 132.93560333251952,
"completions/min_length": 63.2,
"completions/min_terminated_length": 63.2,
"entropy": 0.03249409170821309,
"epoch": 30.406852248394003,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.0,
"learning_rate": 8.580100000000001e-06,
"loss": 0.0026,
"num_tokens": 1396026485.0,
"reward": 1.094492208957672,
"reward_std": 0.04780395328998566,
"rewards/reward_accuracy/mean": 0.99453125,
"rewards/reward_accuracy/std": 0.0475763201713562,
"rewards/reward_format/mean": 0.0999609388411045,
"rewards/reward_format/std": 0.0006250000558793544,
"sampling/importance_sampling_ratio/max": 2.546859622001648,
"sampling/importance_sampling_ratio/mean": 1.004861092567444,
"sampling/importance_sampling_ratio/min": 0.18050796389579774,
"sampling/sampling_logp_difference/max": 1.104217517375946,
"sampling/sampling_logp_difference/mean": 0.0037343008909374474,
"step": 14200,
"step_time": 4.712287591994391
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1646.6,
"completions/max_terminated_length": 1255.0,
"completions/mean_length": 165.807421875,
"completions/mean_terminated_length": 159.92628631591796,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.042930258950218556,
"epoch": 30.428265524625267,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.3515625,
"learning_rate": 8.5791e-06,
"loss": -0.0053,
"num_tokens": 1396978104.0,
"reward": 1.06533203125,
"reward_std": 0.1528247356414795,
"rewards/reward_accuracy/mean": 0.965625,
"rewards/reward_accuracy/std": 0.15085088536143304,
"rewards/reward_format/mean": 0.09970703125,
"rewards/reward_format/std": 0.0037956611486151814,
"sampling/importance_sampling_ratio/max": 2.657397818565369,
"sampling/importance_sampling_ratio/mean": 0.9815398573875427,
"sampling/importance_sampling_ratio/min": 0.04849807135760784,
"sampling/sampling_logp_difference/max": 1.183780950307846,
"sampling/sampling_logp_difference/mean": 0.004295048536732793,
"step": 14210,
"step_time": 7.878322214490618
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1089.1,
"completions/max_terminated_length": 1023.3,
"completions/mean_length": 147.79453125,
"completions/mean_terminated_length": 142.64700622558593,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.035939798085018994,
"epoch": 30.449678800856532,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.1708984375,
"learning_rate": 8.5781e-06,
"loss": -0.0106,
"num_tokens": 1397872378.0,
"reward": 1.0747851848602294,
"reward_std": 0.13061626702547074,
"rewards/reward_accuracy/mean": 0.975,
"rewards/reward_accuracy/std": 0.12950118109583855,
"rewards/reward_format/mean": 0.09978515803813934,
"rewards/reward_format/std": 0.0019402996636927127,
"sampling/importance_sampling_ratio/max": 2.4631505608558655,
"sampling/importance_sampling_ratio/mean": 0.9764104366302491,
"sampling/importance_sampling_ratio/min": 0.06837615147233009,
"sampling/sampling_logp_difference/max": 1.0983691692352295,
"sampling/sampling_logp_difference/mean": 0.003983262553811073,
"step": 14220,
"step_time": 5.363998481995077
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1495.1,
"completions/max_terminated_length": 1115.0,
"completions/mean_length": 160.232421875,
"completions/mean_terminated_length": 151.42816772460938,
"completions/min_length": 63.5,
"completions/min_terminated_length": 63.5,
"entropy": 0.04150299753528088,
"epoch": 30.471092077087796,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.341796875,
"learning_rate": 8.5771e-06,
"loss": 0.0005,
"num_tokens": 1398800365.0,
"reward": 1.058593785762787,
"reward_std": 0.18527790457010268,
"rewards/reward_accuracy/mean": 0.958984375,
"rewards/reward_accuracy/std": 0.18341542780399323,
"rewards/reward_format/mean": 0.09960937723517418,
"rewards/reward_format/std": 0.004056159779429436,
"sampling/importance_sampling_ratio/max": 2.610993230342865,
"sampling/importance_sampling_ratio/mean": 0.9853219866752625,
"sampling/importance_sampling_ratio/min": 0.14653439760440962,
"sampling/sampling_logp_difference/max": 1.094498097896576,
"sampling/sampling_logp_difference/mean": 0.00398638416081667,
"step": 14230,
"step_time": 7.1935279149154665
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1013.5,
"completions/max_terminated_length": 824.8,
"completions/mean_length": 149.17109375,
"completions/mean_terminated_length": 144.04983367919922,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.037010625447146596,
"epoch": 30.492505353319057,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.5761e-06,
"loss": 0.0013,
"num_tokens": 1399699987.0,
"reward": 1.0760547161102294,
"reward_std": 0.10043881312012673,
"rewards/reward_accuracy/mean": 0.976171875,
"rewards/reward_accuracy/std": 0.09999415278434753,
"rewards/reward_format/mean": 0.09988281428813935,
"rewards/reward_format/std": 0.001387959998100996,
"sampling/importance_sampling_ratio/max": 2.4788502931594847,
"sampling/importance_sampling_ratio/mean": 0.9960502743721008,
"sampling/importance_sampling_ratio/min": 0.1959217306226492,
"sampling/sampling_logp_difference/max": 0.8386998534202575,
"sampling/sampling_logp_difference/mean": 0.003682662220671773,
"step": 14240,
"step_time": 5.155205286297132
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1465.0,
"completions/max_terminated_length": 954.7,
"completions/mean_length": 162.141796875,
"completions/mean_terminated_length": 151.17756881713868,
"completions/min_length": 69.1,
"completions/min_terminated_length": 69.1,
"entropy": 0.041263471450656654,
"epoch": 30.51391862955032,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 8.5751e-06,
"loss": -0.011,
"num_tokens": 1400628750.0,
"reward": 1.0585156679153442,
"reward_std": 0.1682581566274166,
"rewards/reward_accuracy/mean": 0.958984375,
"rewards/reward_accuracy/std": 0.16582681536674498,
"rewards/reward_format/mean": 0.09953125268220901,
"rewards/reward_format/std": 0.0045461839530616995,
"sampling/importance_sampling_ratio/max": 2.463644099235535,
"sampling/importance_sampling_ratio/mean": 0.9933397769927979,
"sampling/importance_sampling_ratio/min": 0.10353264696896076,
"sampling/sampling_logp_difference/max": 1.1023980617523192,
"sampling/sampling_logp_difference/mean": 0.003874020138755441,
"step": 14250,
"step_time": 7.052864912096993
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1565.6,
"completions/max_terminated_length": 1268.6,
"completions/mean_length": 166.919921875,
"completions/mean_terminated_length": 156.63842239379883,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.04317458705045283,
"epoch": 30.535331905781586,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.2119140625,
"learning_rate": 8.574100000000001e-06,
"loss": -0.0081,
"num_tokens": 1401573505.0,
"reward": 1.0608789324760437,
"reward_std": 0.17056412994861603,
"rewards/reward_accuracy/mean": 0.961328125,
"rewards/reward_accuracy/std": 0.16837015897035598,
"rewards/reward_format/mean": 0.09955078288912773,
"rewards/reward_format/std": 0.0040519454050809145,
"sampling/importance_sampling_ratio/max": 2.4875369310379027,
"sampling/importance_sampling_ratio/mean": 0.9937393307685852,
"sampling/importance_sampling_ratio/min": 0.10828536138869822,
"sampling/sampling_logp_difference/max": 1.199936068058014,
"sampling/sampling_logp_difference/mean": 0.003959000110626221,
"step": 14260,
"step_time": 7.736222918806016
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1101.3,
"completions/max_terminated_length": 1020.1,
"completions/mean_length": 151.394140625,
"completions/mean_terminated_length": 141.13148040771483,
"completions/min_length": 62.2,
"completions/min_terminated_length": 62.2,
"entropy": 0.038793611852452156,
"epoch": 30.556745182012847,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.74609375,
"learning_rate": 8.573100000000001e-06,
"loss": -0.0079,
"num_tokens": 1402472418.0,
"reward": 1.0725000262260438,
"reward_std": 0.11855997070670128,
"rewards/reward_accuracy/mean": 0.973046875,
"rewards/reward_accuracy/std": 0.11607677713036538,
"rewards/reward_format/mean": 0.09945312663912773,
"rewards/reward_format/std": 0.00400675015989691,
"sampling/importance_sampling_ratio/max": 2.5806321144104003,
"sampling/importance_sampling_ratio/mean": 0.9863331258296967,
"sampling/importance_sampling_ratio/min": 0.14389998987317085,
"sampling/sampling_logp_difference/max": 0.8870960950851441,
"sampling/sampling_logp_difference/mean": 0.003954344941303134,
"step": 14270,
"step_time": 5.427170843110071
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1378.8,
"completions/max_terminated_length": 1295.7,
"completions/mean_length": 162.7796875,
"completions/mean_terminated_length": 151.99131622314454,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.043924996675923464,
"epoch": 30.57815845824411,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.318359375,
"learning_rate": 8.5721e-06,
"loss": -0.0081,
"num_tokens": 1403403742.0,
"reward": 1.072167992591858,
"reward_std": 0.12352021709084511,
"rewards/reward_accuracy/mean": 0.97265625,
"rewards/reward_accuracy/std": 0.122162826359272,
"rewards/reward_format/mean": 0.09951172024011612,
"rewards/reward_format/std": 0.0034799887100234626,
"sampling/importance_sampling_ratio/max": 2.534990441799164,
"sampling/importance_sampling_ratio/mean": 0.9858240902423858,
"sampling/importance_sampling_ratio/min": 0.08464020490646362,
"sampling/sampling_logp_difference/max": 0.9043517589569092,
"sampling/sampling_logp_difference/mean": 0.004053571540862322,
"step": 14280,
"step_time": 6.7693991981825095
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 1055.2,
"completions/max_terminated_length": 953.2,
"completions/mean_length": 139.5890625,
"completions/mean_terminated_length": 138.8489532470703,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.03414423915091902,
"epoch": 30.599571734475376,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.44140625,
"learning_rate": 8.571100000000002e-06,
"loss": -0.0032,
"num_tokens": 1404272354.0,
"reward": 1.0652148604393006,
"reward_std": 0.15155241638422012,
"rewards/reward_accuracy/mean": 0.965234375,
"rewards/reward_accuracy/std": 0.15139417499303817,
"rewards/reward_format/mean": 0.09998046979308128,
"rewards/reward_format/std": 0.0003125000046566129,
"sampling/importance_sampling_ratio/max": 2.4114781975746156,
"sampling/importance_sampling_ratio/mean": 0.9899874329566956,
"sampling/importance_sampling_ratio/min": 0.08881126530468464,
"sampling/sampling_logp_difference/max": 1.12848904132843,
"sampling/sampling_logp_difference/mean": 0.003668561391532421,
"step": 14290,
"step_time": 5.045809256884968
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1249.8,
"completions/max_terminated_length": 952.3,
"completions/mean_length": 156.88671875,
"completions/mean_terminated_length": 153.1944107055664,
"completions/min_length": 68.4,
"completions/min_terminated_length": 68.4,
"entropy": 0.03681958529632538,
"epoch": 30.620985010706637,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0,
"learning_rate": 8.570100000000001e-06,
"loss": 0.0004,
"num_tokens": 1405204272.0,
"reward": 1.06904296875,
"reward_std": 0.13290656581521035,
"rewards/reward_accuracy/mean": 0.969140625,
"rewards/reward_accuracy/std": 0.1324336640536785,
"rewards/reward_format/mean": 0.09990234375,
"rewards/reward_format/std": 0.0015625000698491931,
"sampling/importance_sampling_ratio/max": 2.5105420351028442,
"sampling/importance_sampling_ratio/mean": 0.9857699990272522,
"sampling/importance_sampling_ratio/min": 0.16162517443299293,
"sampling/sampling_logp_difference/max": 1.0264492630958557,
"sampling/sampling_logp_difference/mean": 0.0038624198641628027,
"step": 14300,
"step_time": 5.938490140889189
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1632.6,
"completions/max_terminated_length": 1251.4,
"completions/mean_length": 163.465625,
"completions/mean_terminated_length": 160.52722625732423,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.041853742813691495,
"epoch": 30.6423982869379,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.08642578125,
"learning_rate": 8.5691e-06,
"loss": -0.0063,
"num_tokens": 1406138728.0,
"reward": 1.0396093845367431,
"reward_std": 0.20360189601778983,
"rewards/reward_accuracy/mean": 0.93984375,
"rewards/reward_accuracy/std": 0.2023242861032486,
"rewards/reward_format/mean": 0.09976562559604644,
"rewards/reward_format/std": 0.0035660746041685345,
"sampling/importance_sampling_ratio/max": 2.5946651220321657,
"sampling/importance_sampling_ratio/mean": 0.9884247601032257,
"sampling/importance_sampling_ratio/min": 0.11136341392993927,
"sampling/sampling_logp_difference/max": 1.011179769039154,
"sampling/sampling_logp_difference/mean": 0.003929578140377999,
"step": 14310,
"step_time": 7.76850989209197
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1464.3,
"completions/max_terminated_length": 1348.9,
"completions/mean_length": 166.7125,
"completions/mean_terminated_length": 157.29580078125,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.04176028026267886,
"epoch": 30.663811563169165,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.291015625,
"learning_rate": 8.5681e-06,
"loss": -0.0062,
"num_tokens": 1407080008.0,
"reward": 1.0702148497104644,
"reward_std": 0.13771733567118644,
"rewards/reward_accuracy/mean": 0.970703125,
"rewards/reward_accuracy/std": 0.13590551540255547,
"rewards/reward_format/mean": 0.09951172024011612,
"rewards/reward_format/std": 0.004068794776685536,
"sampling/importance_sampling_ratio/max": 2.5787261486053468,
"sampling/importance_sampling_ratio/mean": 0.9762900114059448,
"sampling/importance_sampling_ratio/min": 0.010199885815382004,
"sampling/sampling_logp_difference/max": 0.9649402260780334,
"sampling/sampling_logp_difference/mean": 0.004071128042414785,
"step": 14320,
"step_time": 7.1753613250999475
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1046.9,
"completions/max_terminated_length": 982.5,
"completions/mean_length": 145.90703125,
"completions/mean_terminated_length": 140.75855865478516,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.03728605262003839,
"epoch": 30.68522483940043,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.75390625,
"learning_rate": 8.5671e-06,
"loss": 0.0006,
"num_tokens": 1407971546.0,
"reward": 1.0662304759025574,
"reward_std": 0.1285705268383026,
"rewards/reward_accuracy/mean": 0.96640625,
"rewards/reward_accuracy/std": 0.12786295488476754,
"rewards/reward_format/mean": 0.09982421919703484,
"rewards/reward_format/std": 0.0020003006793558598,
"sampling/importance_sampling_ratio/max": 2.426810359954834,
"sampling/importance_sampling_ratio/mean": 0.9953199684619903,
"sampling/importance_sampling_ratio/min": 0.18137865364551545,
"sampling/sampling_logp_difference/max": 0.9781936764717102,
"sampling/sampling_logp_difference/mean": 0.0037084373878315093,
"step": 14330,
"step_time": 5.203707051899983
},
{
"clip_ratio/high_max": 2.6331529807066544e-05,
"clip_ratio/high_mean": 3.291441225883318e-06,
"clip_ratio/low_mean": 3.2914413168327883e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 6.582882633665577e-06,
"completions/clipped_ratio": 0.014453125,
"completions/max_length": 1679.9,
"completions/max_terminated_length": 1400.8,
"completions/mean_length": 183.308984375,
"completions/mean_terminated_length": 155.90799255371093,
"completions/min_length": 67.7,
"completions/min_terminated_length": 67.7,
"entropy": 0.05225177314132452,
"epoch": 30.70663811563169,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.3125,
"learning_rate": 8.566100000000001e-06,
"loss": -0.0076,
"num_tokens": 1408956769.0,
"reward": 1.041308629512787,
"reward_std": 0.2121715120971203,
"rewards/reward_accuracy/mean": 0.9421875,
"rewards/reward_accuracy/std": 0.20857203975319863,
"rewards/reward_format/mean": 0.09912109598517418,
"rewards/reward_format/std": 0.006724751438014209,
"sampling/importance_sampling_ratio/max": 2.4085671067237855,
"sampling/importance_sampling_ratio/mean": 0.9747908771038055,
"sampling/importance_sampling_ratio/min": 0.09055159389972686,
"sampling/sampling_logp_difference/max": 1.3738100290298463,
"sampling/sampling_logp_difference/mean": 0.004509385977871716,
"step": 14340,
"step_time": 8.259797080201679
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1156.9,
"completions/max_terminated_length": 946.1,
"completions/mean_length": 144.521484375,
"completions/mean_terminated_length": 140.07264862060546,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.03585155326873064,
"epoch": 30.728051391862955,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.0,
"learning_rate": 8.5651e-06,
"loss": 0.0003,
"num_tokens": 1409841896.0,
"reward": 1.0795312762260436,
"reward_std": 0.11406658217310905,
"rewards/reward_accuracy/mean": 0.9796875,
"rewards/reward_accuracy/std": 0.1130424827337265,
"rewards/reward_format/mean": 0.09984375163912773,
"rewards/reward_format/std": 0.0018290343228727578,
"sampling/importance_sampling_ratio/max": 2.402958428859711,
"sampling/importance_sampling_ratio/mean": 0.9939550697803498,
"sampling/importance_sampling_ratio/min": 0.12312608808279038,
"sampling/sampling_logp_difference/max": 1.0048543334007263,
"sampling/sampling_logp_difference/mean": 0.0036587979178875686,
"step": 14350,
"step_time": 5.698904352509999
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1380.9,
"completions/max_terminated_length": 1067.5,
"completions/mean_length": 145.700390625,
"completions/mean_terminated_length": 139.03385314941406,
"completions/min_length": 65.3,
"completions/min_terminated_length": 65.3,
"entropy": 0.04055021551903337,
"epoch": 30.74946466809422,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0712890625,
"learning_rate": 8.564100000000002e-06,
"loss": -0.0094,
"num_tokens": 1410728393.0,
"reward": 1.0794140696525574,
"reward_std": 0.11014747396111488,
"rewards/reward_accuracy/mean": 0.9796875,
"rewards/reward_accuracy/std": 0.10861148983240128,
"rewards/reward_format/mean": 0.09972656294703483,
"rewards/reward_format/std": 0.003308100183494389,
"sampling/importance_sampling_ratio/max": 2.531111168861389,
"sampling/importance_sampling_ratio/mean": 0.9836588084697724,
"sampling/importance_sampling_ratio/min": 0.14409072063863276,
"sampling/sampling_logp_difference/max": 0.9290401339530945,
"sampling/sampling_logp_difference/mean": 0.004185613989830017,
"step": 14360,
"step_time": 6.773121274707956
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1232.2,
"completions/max_terminated_length": 831.3,
"completions/mean_length": 148.498046875,
"completions/mean_terminated_length": 144.78525390625,
"completions/min_length": 65.2,
"completions/min_terminated_length": 65.2,
"entropy": 0.03407066017389297,
"epoch": 30.77087794432548,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0,
"learning_rate": 8.563100000000001e-06,
"loss": -0.0008,
"num_tokens": 1411624308.0,
"reward": 1.065917980670929,
"reward_std": 0.13862984403967857,
"rewards/reward_accuracy/mean": 0.966015625,
"rewards/reward_accuracy/std": 0.13775658905506133,
"rewards/reward_format/mean": 0.09990234449505805,
"rewards/reward_format/std": 0.001562500116415322,
"sampling/importance_sampling_ratio/max": 2.548479640483856,
"sampling/importance_sampling_ratio/mean": 0.9996628522872925,
"sampling/importance_sampling_ratio/min": 0.15582848023623228,
"sampling/sampling_logp_difference/max": 1.0499410271644591,
"sampling/sampling_logp_difference/mean": 0.003715303563512862,
"step": 14370,
"step_time": 6.053890263609356
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1015.3,
"completions/max_terminated_length": 943.2,
"completions/mean_length": 147.973828125,
"completions/mean_terminated_length": 145.02740173339845,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.03627975289709866,
"epoch": 30.792291220556745,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.158203125,
"learning_rate": 8.5621e-06,
"loss": -0.0047,
"num_tokens": 1412523489.0,
"reward": 1.0686914205551148,
"reward_std": 0.1498661532998085,
"rewards/reward_accuracy/mean": 0.96875,
"rewards/reward_accuracy/std": 0.14952523857355118,
"rewards/reward_format/mean": 0.09994140714406967,
"rewards/reward_format/std": 0.0009375000605359674,
"sampling/importance_sampling_ratio/max": 2.4605993747711183,
"sampling/importance_sampling_ratio/mean": 0.994256192445755,
"sampling/importance_sampling_ratio/min": 0.13014851957559587,
"sampling/sampling_logp_difference/max": 1.0176939427852632,
"sampling/sampling_logp_difference/mean": 0.003979199682362378,
"step": 14380,
"step_time": 5.0832670070900345
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1504.5,
"completions/max_terminated_length": 1091.5,
"completions/mean_length": 158.75859375,
"completions/mean_terminated_length": 150.66063842773437,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.04029250734020025,
"epoch": 30.81370449678801,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.34375,
"learning_rate": 8.561100000000002e-06,
"loss": -0.0022,
"num_tokens": 1413446247.0,
"reward": 1.051933616399765,
"reward_std": 0.18547820970416068,
"rewards/reward_accuracy/mean": 0.95234375,
"rewards/reward_accuracy/std": 0.18398284688591957,
"rewards/reward_format/mean": 0.09958984553813935,
"rewards/reward_format/std": 0.0044771472457796335,
"sampling/importance_sampling_ratio/max": 2.363285684585571,
"sampling/importance_sampling_ratio/mean": 0.9802582502365113,
"sampling/importance_sampling_ratio/min": 0.08316871076822281,
"sampling/sampling_logp_difference/max": 0.8936973690986634,
"sampling/sampling_logp_difference/mean": 0.004114682809449733,
"step": 14390,
"step_time": 7.126537097000982
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1155.8,
"completions/max_terminated_length": 1102.5,
"completions/mean_length": 153.77578125,
"completions/mean_terminated_length": 142.74726257324218,
"completions/min_length": 60.1,
"completions/min_terminated_length": 60.1,
"entropy": 0.041247070068493485,
"epoch": 30.83511777301927,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.224609375,
"learning_rate": 8.560100000000001e-06,
"loss": -0.0033,
"num_tokens": 1414354201.0,
"reward": 1.0781054854393006,
"reward_std": 0.10823895439971239,
"rewards/reward_accuracy/mean": 0.978515625,
"rewards/reward_accuracy/std": 0.1062380351126194,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.0036120747681707144,
"sampling/importance_sampling_ratio/max": 2.4146633744239807,
"sampling/importance_sampling_ratio/mean": 0.9905861675739288,
"sampling/importance_sampling_ratio/min": 0.09729821532964707,
"sampling/sampling_logp_difference/max": 1.2162532925605773,
"sampling/sampling_logp_difference/mean": 0.0038579920772463085,
"step": 14400,
"step_time": 5.91487287869968
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 862.4,
"completions/max_terminated_length": 827.2,
"completions/mean_length": 146.048828125,
"completions/mean_terminated_length": 145.3212127685547,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.03524592309258878,
"epoch": 30.856531049250535,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.240234375,
"learning_rate": 8.5591e-06,
"loss": -0.0024,
"num_tokens": 1415245830.0,
"reward": 1.0620312690734863,
"reward_std": 0.13565654903650284,
"rewards/reward_accuracy/mean": 0.962109375,
"rewards/reward_accuracy/std": 0.13532839715480804,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.0010101743275299669,
"sampling/importance_sampling_ratio/max": 2.204334783554077,
"sampling/importance_sampling_ratio/mean": 0.9817698359489441,
"sampling/importance_sampling_ratio/min": 0.18607795163989066,
"sampling/sampling_logp_difference/max": 1.2188881874084472,
"sampling/sampling_logp_difference/mean": 0.0036997309885919093,
"step": 14410,
"step_time": 4.67348687199119
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 989.9,
"completions/max_terminated_length": 868.5,
"completions/mean_length": 138.7328125,
"completions/mean_terminated_length": 137.25286560058595,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.03338315102737397,
"epoch": 30.8779443254818,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.08251953125,
"learning_rate": 8.5581e-06,
"loss": -0.0028,
"num_tokens": 1416115306.0,
"reward": 1.0913476705551148,
"reward_std": 0.07162974327802658,
"rewards/reward_accuracy/mean": 0.99140625,
"rewards/reward_accuracy/std": 0.07094609290361405,
"rewards/reward_format/mean": 0.09994140714406967,
"rewards/reward_format/std": 0.0009375000605359674,
"sampling/importance_sampling_ratio/max": 2.426090967655182,
"sampling/importance_sampling_ratio/mean": 0.9948554933071136,
"sampling/importance_sampling_ratio/min": 0.1568774774670601,
"sampling/sampling_logp_difference/max": 1.0319427251815796,
"sampling/sampling_logp_difference/mean": 0.0037034027045592666,
"step": 14420,
"step_time": 4.869870997784892
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1250.4,
"completions/max_terminated_length": 1006.8,
"completions/mean_length": 150.612109375,
"completions/mean_terminated_length": 146.18931732177734,
"completions/min_length": 59.9,
"completions/min_terminated_length": 59.9,
"entropy": 0.03938646612223238,
"epoch": 30.899357601713064,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0233154296875,
"learning_rate": 8.5571e-06,
"loss": -0.0085,
"num_tokens": 1417018585.0,
"reward": 1.075976586341858,
"reward_std": 0.1141899935901165,
"rewards/reward_accuracy/mean": 0.976171875,
"rewards/reward_accuracy/std": 0.11344984099268914,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.002517323079518974,
"sampling/importance_sampling_ratio/max": 2.3745346307754516,
"sampling/importance_sampling_ratio/mean": 0.9867721378803254,
"sampling/importance_sampling_ratio/min": 0.09899849183857441,
"sampling/sampling_logp_difference/max": 0.93790003657341,
"sampling/sampling_logp_difference/mean": 0.003938192990608514,
"step": 14430,
"step_time": 6.208960941803525
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1075.3,
"completions/max_terminated_length": 883.5,
"completions/mean_length": 150.624609375,
"completions/mean_terminated_length": 144.01846618652343,
"completions/min_length": 69.6,
"completions/min_terminated_length": 69.6,
"entropy": 0.03739781738258898,
"epoch": 30.920770877944324,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.2080078125,
"learning_rate": 8.556100000000001e-06,
"loss": -0.0009,
"num_tokens": 1417924616.0,
"reward": 1.0583789229393006,
"reward_std": 0.14756183549761773,
"rewards/reward_accuracy/mean": 0.95859375,
"rewards/reward_accuracy/std": 0.14636079221963882,
"rewards/reward_format/mean": 0.09978515729308128,
"rewards/reward_format/std": 0.0020985509501770137,
"sampling/importance_sampling_ratio/max": 2.3711081027984617,
"sampling/importance_sampling_ratio/mean": 0.9744745969772339,
"sampling/importance_sampling_ratio/min": 0.09236810579895974,
"sampling/sampling_logp_difference/max": 1.1367215156555175,
"sampling/sampling_logp_difference/mean": 0.0038804339710623026,
"step": 14440,
"step_time": 5.430977617122698
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1286.8,
"completions/max_terminated_length": 1046.0,
"completions/mean_length": 158.687109375,
"completions/mean_terminated_length": 152.10176696777344,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.04230254827998579,
"epoch": 30.94218415417559,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.12255859375,
"learning_rate": 8.5551e-06,
"loss": -0.008,
"num_tokens": 1418851415.0,
"reward": 1.075097680091858,
"reward_std": 0.11461505219340325,
"rewards/reward_accuracy/mean": 0.975390625,
"rewards/reward_accuracy/std": 0.11341421157121659,
"rewards/reward_format/mean": 0.09970703348517418,
"rewards/reward_format/std": 0.003395841224119067,
"sampling/importance_sampling_ratio/max": 2.6065078020095824,
"sampling/importance_sampling_ratio/mean": 0.9841635346412658,
"sampling/importance_sampling_ratio/min": 0.11901859417557717,
"sampling/sampling_logp_difference/max": 0.9662275671958923,
"sampling/sampling_logp_difference/mean": 0.004026299947872758,
"step": 14450,
"step_time": 6.237514326183009
},
{
"clip_ratio/high_max": 3.977091910201125e-06,
"clip_ratio/high_mean": 4.971364887751406e-07,
"clip_ratio/low_mean": 2.378159501859045e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.875296013371553e-06,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1253.1,
"completions/max_terminated_length": 992.3,
"completions/mean_length": 152.8359375,
"completions/mean_terminated_length": 139.41487579345704,
"completions/min_length": 62.6,
"completions/min_terminated_length": 62.6,
"entropy": 0.03670146425720304,
"epoch": 30.963597430406853,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.5541e-06,
"loss": -0.0052,
"num_tokens": 1419763907.0,
"reward": 1.0813867330551148,
"reward_std": 0.09997922098264098,
"rewards/reward_accuracy/mean": 0.98203125,
"rewards/reward_accuracy/std": 0.09695164412260056,
"rewards/reward_format/mean": 0.09935546964406967,
"rewards/reward_format/std": 0.003724556416273117,
"sampling/importance_sampling_ratio/max": 2.4546119451522825,
"sampling/importance_sampling_ratio/mean": 0.9986008942127228,
"sampling/importance_sampling_ratio/min": 0.18992761373519898,
"sampling/sampling_logp_difference/max": 1.0033657670021057,
"sampling/sampling_logp_difference/mean": 0.0036069896072149278,
"step": 14460,
"step_time": 6.2842462348868136
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1380.6,
"completions/max_terminated_length": 1096.6,
"completions/mean_length": 169.492578125,
"completions/mean_terminated_length": 154.76743698120117,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.041160128987394275,
"epoch": 30.985010706638114,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.553100000000001e-06,
"loss": -0.0055,
"num_tokens": 1420712864.0,
"reward": 1.064511740207672,
"reward_std": 0.147392565314658,
"rewards/reward_accuracy/mean": 0.965234375,
"rewards/reward_accuracy/std": 0.14439024776220322,
"rewards/reward_format/mean": 0.09927734434604644,
"rewards/reward_format/std": 0.005197008303366601,
"sampling/importance_sampling_ratio/max": 2.341817581653595,
"sampling/importance_sampling_ratio/mean": 0.982728636264801,
"sampling/importance_sampling_ratio/min": 0.08299479484558106,
"sampling/sampling_logp_difference/max": 1.1524540424346923,
"sampling/sampling_logp_difference/mean": 0.0040579738561064005,
"step": 14470,
"step_time": 6.888948197310674
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1155.1,
"completions/max_terminated_length": 868.7,
"completions/mean_length": 143.915234375,
"completions/mean_terminated_length": 140.92267532348632,
"completions/min_length": 69.9,
"completions/min_terminated_length": 69.9,
"entropy": 0.0358028766233474,
"epoch": 31.00642398286938,
"frac_reward_zero_std": 0.9125,
"grad_norm": 1.109375,
"learning_rate": 8.5521e-06,
"loss": 0.0011,
"num_tokens": 1421601847.0,
"reward": 1.080761730670929,
"reward_std": 0.11057721227407455,
"rewards/reward_accuracy/mean": 0.980859375,
"rewards/reward_accuracy/std": 0.10955706015229225,
"rewards/reward_format/mean": 0.09990234449505805,
"rewards/reward_format/std": 0.001562500116415322,
"sampling/importance_sampling_ratio/max": 2.519132304191589,
"sampling/importance_sampling_ratio/mean": 0.9963778853416443,
"sampling/importance_sampling_ratio/min": 0.10473545789718627,
"sampling/sampling_logp_difference/max": 0.9223577618598938,
"sampling/sampling_logp_difference/mean": 0.003852595039643347,
"step": 14480,
"step_time": 5.46514263760182
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 8.167951136783813e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 8.167951136783813e-07,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1427.6,
"completions/max_terminated_length": 1115.5,
"completions/mean_length": 161.603125,
"completions/mean_terminated_length": 149.03148345947267,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.040440950402989985,
"epoch": 31.027837259100643,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.551100000000002e-06,
"loss": -0.0056,
"num_tokens": 1422532319.0,
"reward": 1.0686328411102295,
"reward_std": 0.11598096638917924,
"rewards/reward_accuracy/mean": 0.969140625,
"rewards/reward_accuracy/std": 0.11398643255233765,
"rewards/reward_format/mean": 0.09949218928813934,
"rewards/reward_format/std": 0.003674388164654374,
"sampling/importance_sampling_ratio/max": 2.443987214565277,
"sampling/importance_sampling_ratio/mean": 0.9817799866199494,
"sampling/importance_sampling_ratio/min": 0.05521585643291473,
"sampling/sampling_logp_difference/max": 0.9729164183139801,
"sampling/sampling_logp_difference/mean": 0.003974406304769218,
"step": 14490,
"step_time": 6.917939205488073
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1598.2,
"completions/max_terminated_length": 1341.7,
"completions/mean_length": 173.58046875,
"completions/mean_terminated_length": 162.56033325195312,
"completions/min_length": 62.4,
"completions/min_terminated_length": 62.4,
"entropy": 0.05030863920692354,
"epoch": 31.049250535331907,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.259765625,
"learning_rate": 8.550100000000001e-06,
"loss": -0.0043,
"num_tokens": 1423498605.0,
"reward": 1.0741601824760436,
"reward_std": 0.1371159575879574,
"rewards/reward_accuracy/mean": 0.974609375,
"rewards/reward_accuracy/std": 0.13452068269252776,
"rewards/reward_format/mean": 0.09955078214406968,
"rewards/reward_format/std": 0.004638466518372297,
"sampling/importance_sampling_ratio/max": 2.4483499050140383,
"sampling/importance_sampling_ratio/mean": 0.9769177377223969,
"sampling/importance_sampling_ratio/min": 0.11850140411406755,
"sampling/sampling_logp_difference/max": 1.2815865993499755,
"sampling/sampling_logp_difference/mean": 0.0043835427146404985,
"step": 14500,
"step_time": 7.95112578458793
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 982.0,
"completions/max_terminated_length": 735.1,
"completions/mean_length": 144.65234375,
"completions/mean_terminated_length": 140.95961303710936,
"completions/min_length": 65.3,
"completions/min_terminated_length": 65.3,
"entropy": 0.037748194043524565,
"epoch": 31.07066381156317,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.549100000000001e-06,
"loss": -0.0066,
"num_tokens": 1424385475.0,
"reward": 1.081054699420929,
"reward_std": 0.09746723398566245,
"rewards/reward_accuracy/mean": 0.98125,
"rewards/reward_accuracy/std": 0.09647932872176171,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.0020492353942245245,
"sampling/importance_sampling_ratio/max": 2.316783142089844,
"sampling/importance_sampling_ratio/mean": 0.9858493506908417,
"sampling/importance_sampling_ratio/min": 0.07153053171932697,
"sampling/sampling_logp_difference/max": 1.1074550926685334,
"sampling/sampling_logp_difference/mean": 0.004000258352607489,
"step": 14510,
"step_time": 5.016416681287228
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 477.0,
"completions/max_terminated_length": 457.9,
"completions/mean_length": 145.0671875,
"completions/mean_terminated_length": 142.90910797119142,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.034242298896424474,
"epoch": 31.092077087794433,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.2734375,
"learning_rate": 8.5481e-06,
"loss": -0.0023,
"num_tokens": 1425278815.0,
"reward": 1.0748828291893004,
"reward_std": 0.10175931602716445,
"rewards/reward_accuracy/mean": 0.975,
"rewards/reward_accuracy/std": 0.10149640589952469,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.0008777966722846031,
"sampling/importance_sampling_ratio/max": 2.405622363090515,
"sampling/importance_sampling_ratio/mean": 0.9848839581012726,
"sampling/importance_sampling_ratio/min": 0.18490227907896042,
"sampling/sampling_logp_difference/max": 1.0541200637817383,
"sampling/sampling_logp_difference/mean": 0.0036096410127356648,
"step": 14520,
"step_time": 3.062874496585573
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1460.0,
"completions/max_terminated_length": 1163.6,
"completions/mean_length": 160.441015625,
"completions/mean_terminated_length": 154.5368194580078,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.03973812868352979,
"epoch": 31.113490364025697,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 8.5471e-06,
"loss": -0.0079,
"num_tokens": 1426217768.0,
"reward": 1.0587890803813935,
"reward_std": 0.15636249110102654,
"rewards/reward_accuracy/mean": 0.958984375,
"rewards/reward_accuracy/std": 0.1554957829415798,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.002233161125332117,
"sampling/importance_sampling_ratio/max": 2.473085713386536,
"sampling/importance_sampling_ratio/mean": 0.9906524181365967,
"sampling/importance_sampling_ratio/min": 0.12865481786429883,
"sampling/sampling_logp_difference/max": 0.8516607284545898,
"sampling/sampling_logp_difference/mean": 0.003823996591381729,
"step": 14530,
"step_time": 7.043616248687613
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1075.1,
"completions/max_terminated_length": 766.0,
"completions/mean_length": 155.6140625,
"completions/mean_terminated_length": 148.2851364135742,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.04110186689067632,
"epoch": 31.134903640256958,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.32421875,
"learning_rate": 8.546100000000001e-06,
"loss": -0.0026,
"num_tokens": 1427137036.0,
"reward": 1.0575586140155793,
"reward_std": 0.15572775676846504,
"rewards/reward_accuracy/mean": 0.9578125,
"rewards/reward_accuracy/std": 0.15449313297867776,
"rewards/reward_format/mean": 0.09974609538912774,
"rewards/reward_format/std": 0.002637504693120718,
"sampling/importance_sampling_ratio/max": 2.364823508262634,
"sampling/importance_sampling_ratio/mean": 0.9873289048671723,
"sampling/importance_sampling_ratio/min": 0.15695872530341148,
"sampling/sampling_logp_difference/max": 1.096609628200531,
"sampling/sampling_logp_difference/mean": 0.004041032423265279,
"step": 14540,
"step_time": 5.680176205883617
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1417.1,
"completions/max_terminated_length": 1215.8,
"completions/mean_length": 151.003515625,
"completions/mean_terminated_length": 147.3126533508301,
"completions/min_length": 67.4,
"completions/min_terminated_length": 67.4,
"entropy": 0.044286220939829944,
"epoch": 31.156316916488223,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 8.5451e-06,
"loss": -0.0059,
"num_tokens": 1428038629.0,
"reward": 1.0639257907867432,
"reward_std": 0.14582685753703117,
"rewards/reward_accuracy/mean": 0.9640625,
"rewards/reward_accuracy/std": 0.14512174651026727,
"rewards/reward_format/mean": 0.09986328184604645,
"rewards/reward_format/std": 0.0020035744411870835,
"sampling/importance_sampling_ratio/max": 2.5705044507980346,
"sampling/importance_sampling_ratio/mean": 0.9918880105018616,
"sampling/importance_sampling_ratio/min": 0.07857091883197427,
"sampling/sampling_logp_difference/max": 1.1138450980186463,
"sampling/sampling_logp_difference/mean": 0.0043531152419745926,
"step": 14550,
"step_time": 6.651401296793483
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1198.5,
"completions/max_terminated_length": 1168.1,
"completions/mean_length": 164.17109375,
"completions/mean_terminated_length": 151.76568145751952,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.04458393775857985,
"epoch": 31.177730192719487,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.1953125,
"learning_rate": 8.5441e-06,
"loss": -0.0053,
"num_tokens": 1428982075.0,
"reward": 1.0486914336681366,
"reward_std": 0.18360560089349748,
"rewards/reward_accuracy/mean": 0.94921875,
"rewards/reward_accuracy/std": 0.18174214214086531,
"rewards/reward_format/mean": 0.0994726575911045,
"rewards/reward_format/std": 0.0038768368074670436,
"sampling/importance_sampling_ratio/max": 2.543093180656433,
"sampling/importance_sampling_ratio/mean": 0.9804613411426544,
"sampling/importance_sampling_ratio/min": 0.11923401653766633,
"sampling/sampling_logp_difference/max": 1.0331358909606934,
"sampling/sampling_logp_difference/mean": 0.003931734291836619,
"step": 14560,
"step_time": 6.232573064015014
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1283.5,
"completions/max_terminated_length": 1066.9,
"completions/mean_length": 149.506640625,
"completions/mean_terminated_length": 144.4102294921875,
"completions/min_length": 70.0,
"completions/min_terminated_length": 70.0,
"entropy": 0.03823063257150352,
"epoch": 31.199143468950748,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.55078125,
"learning_rate": 8.543100000000001e-06,
"loss": -0.006,
"num_tokens": 1429882172.0,
"reward": 1.0900000214576722,
"reward_std": 0.07177590057253838,
"rewards/reward_accuracy/mean": 0.990234375,
"rewards/reward_accuracy/std": 0.07027983516454697,
"rewards/reward_format/mean": 0.09976562708616257,
"rewards/reward_format/std": 0.0025854270905256273,
"sampling/importance_sampling_ratio/max": 2.455686640739441,
"sampling/importance_sampling_ratio/mean": 0.9856718599796295,
"sampling/importance_sampling_ratio/min": 0.12209761515259743,
"sampling/sampling_logp_difference/max": 1.036576509475708,
"sampling/sampling_logp_difference/mean": 0.003933058935217559,
"step": 14570,
"step_time": 6.143730172689539
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1166.6,
"completions/max_terminated_length": 894.2,
"completions/mean_length": 151.542578125,
"completions/mean_terminated_length": 149.32685317993165,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.03519968858454377,
"epoch": 31.220556745182012,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.400390625,
"learning_rate": 8.5421e-06,
"loss": -0.0053,
"num_tokens": 1430793001.0,
"reward": 1.0714257895946502,
"reward_std": 0.11747472286224366,
"rewards/reward_accuracy/mean": 0.971484375,
"rewards/reward_accuracy/std": 0.11702395230531693,
"rewards/reward_format/mean": 0.09994140639901161,
"rewards/reward_format/std": 0.0009375000139698386,
"sampling/importance_sampling_ratio/max": 2.37431560754776,
"sampling/importance_sampling_ratio/mean": 0.9996383607387542,
"sampling/importance_sampling_ratio/min": 0.0455668106675148,
"sampling/sampling_logp_difference/max": 0.9792012095451355,
"sampling/sampling_logp_difference/mean": 0.0037037010537460447,
"step": 14580,
"step_time": 5.560547282415792
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1087.6,
"completions/max_terminated_length": 1010.1,
"completions/mean_length": 155.850390625,
"completions/mean_terminated_length": 150.73719177246093,
"completions/min_length": 63.2,
"completions/min_terminated_length": 63.2,
"entropy": 0.039862418291158976,
"epoch": 31.241970021413277,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.6484375,
"learning_rate": 8.5411e-06,
"loss": -0.0071,
"num_tokens": 1431714474.0,
"reward": 1.068125021457672,
"reward_std": 0.14384609162807466,
"rewards/reward_accuracy/mean": 0.968359375,
"rewards/reward_accuracy/std": 0.14281883910298349,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0022527996217831968,
"sampling/importance_sampling_ratio/max": 2.5301161766052247,
"sampling/importance_sampling_ratio/mean": 0.9951824247837067,
"sampling/importance_sampling_ratio/min": 0.17919893525540828,
"sampling/sampling_logp_difference/max": 1.0090657651424408,
"sampling/sampling_logp_difference/mean": 0.003961367974989116,
"step": 14590,
"step_time": 5.477002454208559
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1137.9,
"completions/max_terminated_length": 905.5,
"completions/mean_length": 157.583203125,
"completions/mean_terminated_length": 152.40160675048827,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.037905059102922675,
"epoch": 31.26338329764454,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.478515625,
"learning_rate": 8.540100000000001e-06,
"loss": -0.0004,
"num_tokens": 1432640447.0,
"reward": 1.0669140815734863,
"reward_std": 0.11155187785625457,
"rewards/reward_accuracy/mean": 0.9671875,
"rewards/reward_accuracy/std": 0.11030598729848862,
"rewards/reward_format/mean": 0.0997265636920929,
"rewards/reward_format/std": 0.0024692215491086246,
"sampling/importance_sampling_ratio/max": 2.6076314091682433,
"sampling/importance_sampling_ratio/mean": 0.9819428205490113,
"sampling/importance_sampling_ratio/min": 0.13453273773193358,
"sampling/sampling_logp_difference/max": 1.028035616874695,
"sampling/sampling_logp_difference/mean": 0.0038265761453658343,
"step": 14600,
"step_time": 5.80946212040435
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1317.2,
"completions/max_terminated_length": 1149.2,
"completions/mean_length": 161.32265625,
"completions/mean_terminated_length": 150.4080680847168,
"completions/min_length": 66.5,
"completions/min_terminated_length": 66.5,
"entropy": 0.04355214352253824,
"epoch": 31.284796573875802,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.640625,
"learning_rate": 8.539100000000001e-06,
"loss": -0.0077,
"num_tokens": 1433572009.0,
"reward": 1.069101595878601,
"reward_std": 0.12741547897458078,
"rewards/reward_accuracy/mean": 0.96953125,
"rewards/reward_accuracy/std": 0.12611351981759072,
"rewards/reward_format/mean": 0.09957031458616257,
"rewards/reward_format/std": 0.0032227923162281512,
"sampling/importance_sampling_ratio/max": 2.349758434295654,
"sampling/importance_sampling_ratio/mean": 0.9786294877529145,
"sampling/importance_sampling_ratio/min": 0.13499519936740398,
"sampling/sampling_logp_difference/max": 1.112660014629364,
"sampling/sampling_logp_difference/mean": 0.004166055610403419,
"step": 14610,
"step_time": 6.570866735107847
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 991.7,
"completions/max_terminated_length": 752.2,
"completions/mean_length": 154.7453125,
"completions/mean_terminated_length": 147.51549224853517,
"completions/min_length": 63.5,
"completions/min_terminated_length": 63.5,
"entropy": 0.037801022129133346,
"epoch": 31.306209850107066,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.5381e-06,
"loss": -0.002,
"num_tokens": 1434479885.0,
"reward": 1.0714843988418579,
"reward_std": 0.13210971429944038,
"rewards/reward_accuracy/mean": 0.971875,
"rewards/reward_accuracy/std": 0.13042339012026788,
"rewards/reward_format/mean": 0.09960937649011611,
"rewards/reward_format/std": 0.003103564982302487,
"sampling/importance_sampling_ratio/max": 2.37160838842392,
"sampling/importance_sampling_ratio/mean": 0.9794017374515533,
"sampling/importance_sampling_ratio/min": 0.12849444430321455,
"sampling/sampling_logp_difference/max": 1.0032468855381012,
"sampling/sampling_logp_difference/mean": 0.0038500481750816107,
"step": 14620,
"step_time": 5.142583189078141
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1111.0,
"completions/max_terminated_length": 1031.0,
"completions/mean_length": 172.474609375,
"completions/mean_terminated_length": 160.15606536865235,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.04350771177560091,
"epoch": 31.32762312633833,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.85546875,
"learning_rate": 8.5371e-06,
"loss": -0.0031,
"num_tokens": 1435442892.0,
"reward": 1.0539844036102295,
"reward_std": 0.1458825461566448,
"rewards/reward_accuracy/mean": 0.9546875,
"rewards/reward_accuracy/std": 0.14403965696692467,
"rewards/reward_format/mean": 0.09929687604308128,
"rewards/reward_format/std": 0.004290223238058388,
"sampling/importance_sampling_ratio/max": 2.734179949760437,
"sampling/importance_sampling_ratio/mean": 0.9808323621749878,
"sampling/importance_sampling_ratio/min": 0.12672538682818413,
"sampling/sampling_logp_difference/max": 1.1172697305679322,
"sampling/sampling_logp_difference/mean": 0.00412061617244035,
"step": 14630,
"step_time": 5.674088431187556
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008984375,
"completions/max_length": 1404.0,
"completions/max_terminated_length": 1151.9,
"completions/mean_length": 172.6203125,
"completions/mean_terminated_length": 155.96731567382812,
"completions/min_length": 60.8,
"completions/min_terminated_length": 60.8,
"entropy": 0.046102575049735604,
"epoch": 31.349036402569592,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 8.536100000000001e-06,
"loss": -0.0093,
"num_tokens": 1436401952.0,
"reward": 1.0591601729393005,
"reward_std": 0.13819165378808976,
"rewards/reward_accuracy/mean": 0.959765625,
"rewards/reward_accuracy/std": 0.13621186465024948,
"rewards/reward_format/mean": 0.09939453303813935,
"rewards/reward_format/std": 0.004373216186650097,
"sampling/importance_sampling_ratio/max": 2.3703866481781004,
"sampling/importance_sampling_ratio/mean": 0.9813894152641296,
"sampling/importance_sampling_ratio/min": 0.15363135263323785,
"sampling/sampling_logp_difference/max": 1.14021155834198,
"sampling/sampling_logp_difference/mean": 0.0041376544628292326,
"step": 14640,
"step_time": 6.929479660998913
},
{
"clip_ratio/high_max": 3.14034718030598e-05,
"clip_ratio/high_mean": 3.925433975382475e-06,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.925433975382475e-06,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1153.1,
"completions/max_terminated_length": 932.9,
"completions/mean_length": 158.84453125,
"completions/mean_terminated_length": 146.4614028930664,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.047044863691553473,
"epoch": 31.370449678800856,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.142578125,
"learning_rate": 8.5351e-06,
"loss": -0.0073,
"num_tokens": 1437325122.0,
"reward": 1.0500195562839507,
"reward_std": 0.19523885771632193,
"rewards/reward_accuracy/mean": 0.950390625,
"rewards/reward_accuracy/std": 0.19371027275919914,
"rewards/reward_format/mean": 0.09962890595197678,
"rewards/reward_format/std": 0.0032063792925328015,
"sampling/importance_sampling_ratio/max": 2.483075714111328,
"sampling/importance_sampling_ratio/mean": 0.9867660403251648,
"sampling/importance_sampling_ratio/min": 0.10115364342927932,
"sampling/sampling_logp_difference/max": 0.9981510937213898,
"sampling/sampling_logp_difference/mean": 0.004274189914576709,
"step": 14650,
"step_time": 5.813602831421304
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1404.0,
"completions/max_terminated_length": 1298.6,
"completions/mean_length": 171.06328125,
"completions/mean_terminated_length": 162.54627380371093,
"completions/min_length": 61.5,
"completions/min_terminated_length": 61.5,
"entropy": 0.044954994088038804,
"epoch": 31.39186295503212,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.53515625,
"learning_rate": 8.5341e-06,
"loss": 0.0014,
"num_tokens": 1438276628.0,
"reward": 1.0887500166893005,
"reward_std": 0.07367768466938288,
"rewards/reward_accuracy/mean": 0.9890625,
"rewards/reward_accuracy/std": 0.072615697234869,
"rewards/reward_format/mean": 0.09968750104308129,
"rewards/reward_format/std": 0.0026498047402128575,
"sampling/importance_sampling_ratio/max": 2.465327525138855,
"sampling/importance_sampling_ratio/mean": 0.9835843682289124,
"sampling/importance_sampling_ratio/min": 0.042619810067117216,
"sampling/sampling_logp_difference/max": 1.1007575988769531,
"sampling/sampling_logp_difference/mean": 0.003972793114371598,
"step": 14660,
"step_time": 6.827656372514321
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1176.8,
"completions/max_terminated_length": 554.0,
"completions/mean_length": 146.771875,
"completions/mean_terminated_length": 141.5548828125,
"completions/min_length": 70.4,
"completions/min_terminated_length": 70.4,
"entropy": 0.03422149382531643,
"epoch": 31.41327623126338,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.40234375,
"learning_rate": 8.533100000000001e-06,
"loss": -0.0092,
"num_tokens": 1439169036.0,
"reward": 1.0842578291893006,
"reward_std": 0.09865860268473625,
"rewards/reward_accuracy/mean": 0.984375,
"rewards/reward_accuracy/std": 0.09762610048055649,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.0016351743834093213,
"sampling/importance_sampling_ratio/max": 2.542578339576721,
"sampling/importance_sampling_ratio/mean": 0.9924372732639313,
"sampling/importance_sampling_ratio/min": 0.10022579152137041,
"sampling/sampling_logp_difference/max": 1.1575456380844116,
"sampling/sampling_logp_difference/mean": 0.00374704715795815,
"step": 14670,
"step_time": 5.675430140909157
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 914.7,
"completions/max_terminated_length": 828.6,
"completions/mean_length": 142.1734375,
"completions/mean_terminated_length": 140.69459686279296,
"completions/min_length": 60.0,
"completions/min_terminated_length": 60.0,
"entropy": 0.03333376334048808,
"epoch": 31.434689507494646,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.64453125,
"learning_rate": 8.532100000000001e-06,
"loss": 0.0021,
"num_tokens": 1440043384.0,
"reward": 1.087011730670929,
"reward_std": 0.08968546763062477,
"rewards/reward_accuracy/mean": 0.987109375,
"rewards/reward_accuracy/std": 0.08919157013297081,
"rewards/reward_format/mean": 0.09990234449505805,
"rewards/reward_format/std": 0.0013785743853077293,
"sampling/importance_sampling_ratio/max": 2.524800944328308,
"sampling/importance_sampling_ratio/mean": 1.0016316950321198,
"sampling/importance_sampling_ratio/min": 0.21847807802259922,
"sampling/sampling_logp_difference/max": 1.0637360274791718,
"sampling/sampling_logp_difference/mean": 0.0033918300876393916,
"step": 14680,
"step_time": 4.700451494011213
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1493.2,
"completions/max_terminated_length": 1232.2,
"completions/mean_length": 164.009765625,
"completions/mean_terminated_length": 150.79896392822266,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.04346103726420551,
"epoch": 31.45610278372591,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.228515625,
"learning_rate": 8.5311e-06,
"loss": -0.0038,
"num_tokens": 1440980369.0,
"reward": 1.0768750309944153,
"reward_std": 0.11281369626522064,
"rewards/reward_accuracy/mean": 0.97734375,
"rewards/reward_accuracy/std": 0.11060158833861351,
"rewards/reward_format/mean": 0.09953125193715096,
"rewards/reward_format/std": 0.0031793986912816764,
"sampling/importance_sampling_ratio/max": 2.4165570020675657,
"sampling/importance_sampling_ratio/mean": 0.9860367953777314,
"sampling/importance_sampling_ratio/min": 0.09946273900568485,
"sampling/sampling_logp_difference/max": 0.9820831716060638,
"sampling/sampling_logp_difference/mean": 0.004006166919134557,
"step": 14690,
"step_time": 7.2842525303858565
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 945.0,
"completions/max_terminated_length": 622.6,
"completions/mean_length": 140.812890625,
"completions/mean_terminated_length": 138.58562927246095,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.034209212521091104,
"epoch": 31.477516059957175,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.530100000000002e-06,
"loss": -0.0021,
"num_tokens": 1441859138.0,
"reward": 1.056542980670929,
"reward_std": 0.14868807643651963,
"rewards/reward_accuracy/mean": 0.956640625,
"rewards/reward_accuracy/std": 0.1480366237461567,
"rewards/reward_format/mean": 0.09990234449505805,
"rewards/reward_format/std": 0.001562500116415322,
"sampling/importance_sampling_ratio/max": 2.2747286677360536,
"sampling/importance_sampling_ratio/mean": 0.9864168167114258,
"sampling/importance_sampling_ratio/min": 0.22203650819137694,
"sampling/sampling_logp_difference/max": 1.0409687638282776,
"sampling/sampling_logp_difference/mean": 0.0037973446771502493,
"step": 14700,
"step_time": 4.667397497611819
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1159.5,
"completions/max_terminated_length": 748.9,
"completions/mean_length": 152.35234375,
"completions/mean_terminated_length": 142.0780937194824,
"completions/min_length": 62.5,
"completions/min_terminated_length": 62.5,
"entropy": 0.03801354253664613,
"epoch": 31.498929336188436,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.466796875,
"learning_rate": 8.5291e-06,
"loss": -0.0014,
"num_tokens": 1442761928.0,
"reward": 1.0805078268051147,
"reward_std": 0.1062471441924572,
"rewards/reward_accuracy/mean": 0.980859375,
"rewards/reward_accuracy/std": 0.10461561903357505,
"rewards/reward_format/mean": 0.09964843839406967,
"rewards/reward_format/std": 0.0030424260767176747,
"sampling/importance_sampling_ratio/max": 2.3774768471717835,
"sampling/importance_sampling_ratio/mean": 0.9891697466373444,
"sampling/importance_sampling_ratio/min": 0.13950405046343803,
"sampling/sampling_logp_difference/max": 0.9350452423095703,
"sampling/sampling_logp_difference/mean": 0.0036811229772865774,
"step": 14710,
"step_time": 5.825686219500494
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 500.0,
"completions/max_terminated_length": 500.0,
"completions/mean_length": 132.1421875,
"completions/mean_terminated_length": 132.1421875,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.03104742388240993,
"epoch": 31.5203426124197,
"frac_reward_zero_std": 0.96875,
"grad_norm": 0.515625,
"learning_rate": 8.5281e-06,
"loss": -0.0011,
"num_tokens": 1443612788.0,
"reward": 1.0976562738418578,
"reward_std": 0.030142973363399505,
"rewards/reward_accuracy/mean": 0.99765625,
"rewards/reward_accuracy/std": 0.030142973363399505,
"rewards/reward_format/mean": 0.10000000149011612,
"rewards/reward_format/std": 0.0,
"sampling/importance_sampling_ratio/max": 2.536046051979065,
"sampling/importance_sampling_ratio/mean": 0.990113639831543,
"sampling/importance_sampling_ratio/min": 0.13111745417118073,
"sampling/sampling_logp_difference/max": 0.9107446193695068,
"sampling/sampling_logp_difference/mean": 0.0035148402908816933,
"step": 14720,
"step_time": 2.8792981892096576
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 845.4,
"completions/max_terminated_length": 845.2,
"completions/mean_length": 143.39765625,
"completions/mean_terminated_length": 142.66234741210937,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.03478803592734039,
"epoch": 31.541755888650965,
"frac_reward_zero_std": 0.96875,
"grad_norm": 0.0,
"learning_rate": 8.5271e-06,
"loss": -0.001,
"num_tokens": 1444503358.0,
"reward": 1.0909765720367433,
"reward_std": 0.05228704989422113,
"rewards/reward_accuracy/mean": 0.991015625,
"rewards/reward_accuracy/std": 0.05175130367279053,
"rewards/reward_format/mean": 0.09996093809604645,
"rewards/reward_format/std": 0.0006250000093132258,
"sampling/importance_sampling_ratio/max": 2.397885870933533,
"sampling/importance_sampling_ratio/mean": 0.9936851799488068,
"sampling/importance_sampling_ratio/min": 0.19677759185433388,
"sampling/sampling_logp_difference/max": 0.8713787198066711,
"sampling/sampling_logp_difference/mean": 0.003658768814057112,
"step": 14730,
"step_time": 4.316711634909734
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1430.4,
"completions/max_terminated_length": 1086.1,
"completions/mean_length": 159.12890625,
"completions/mean_terminated_length": 148.9013687133789,
"completions/min_length": 70.0,
"completions/min_terminated_length": 70.0,
"entropy": 0.03685863849241287,
"epoch": 31.563169164882225,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.2119140625,
"learning_rate": 8.526100000000001e-06,
"loss": -0.0061,
"num_tokens": 1445428456.0,
"reward": 1.0683203101158143,
"reward_std": 0.1429626889526844,
"rewards/reward_accuracy/mean": 0.96875,
"rewards/reward_accuracy/std": 0.14110500663518905,
"rewards/reward_format/mean": 0.09957031235098839,
"rewards/reward_format/std": 0.003530353005044162,
"sampling/importance_sampling_ratio/max": 2.4768807888031006,
"sampling/importance_sampling_ratio/mean": 0.9835797667503356,
"sampling/importance_sampling_ratio/min": 0.1772962160408497,
"sampling/sampling_logp_difference/max": 0.9201969027519226,
"sampling/sampling_logp_difference/mean": 0.0037706084782257675,
"step": 14740,
"step_time": 6.840511132610845
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1415.8,
"completions/max_terminated_length": 1227.5,
"completions/mean_length": 175.54453125,
"completions/mean_terminated_length": 162.4694076538086,
"completions/min_length": 66.4,
"completions/min_terminated_length": 66.4,
"entropy": 0.04813501876778901,
"epoch": 31.58458244111349,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.5703125,
"learning_rate": 8.5251e-06,
"loss": -0.0041,
"num_tokens": 1446396138.0,
"reward": 1.052324229478836,
"reward_std": 0.17199645340442657,
"rewards/reward_accuracy/mean": 0.952734375,
"rewards/reward_accuracy/std": 0.17067642733454705,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.0038181554758921266,
"sampling/importance_sampling_ratio/max": 2.4123905658721925,
"sampling/importance_sampling_ratio/mean": 0.9883544325828553,
"sampling/importance_sampling_ratio/min": 0.11811874564737082,
"sampling/sampling_logp_difference/max": 1.055956882238388,
"sampling/sampling_logp_difference/mean": 0.004272862989455462,
"step": 14750,
"step_time": 7.183762314388877
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1438.8,
"completions/max_terminated_length": 1112.8,
"completions/mean_length": 161.43046875,
"completions/mean_terminated_length": 152.67159576416014,
"completions/min_length": 65.3,
"completions/min_terminated_length": 65.3,
"entropy": 0.04056219214107841,
"epoch": 31.605995717344754,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.20703125,
"learning_rate": 8.5241e-06,
"loss": -0.0074,
"num_tokens": 1447332264.0,
"reward": 1.050878918170929,
"reward_std": 0.1839476354420185,
"rewards/reward_accuracy/mean": 0.951171875,
"rewards/reward_accuracy/std": 0.18267623111605644,
"rewards/reward_format/mean": 0.09970703274011612,
"rewards/reward_format/std": 0.002943085343576968,
"sampling/importance_sampling_ratio/max": 2.2147494077682497,
"sampling/importance_sampling_ratio/mean": 0.977659958600998,
"sampling/importance_sampling_ratio/min": 0.064616160094738,
"sampling/sampling_logp_difference/max": 0.9592396974563598,
"sampling/sampling_logp_difference/mean": 0.003975667152553796,
"step": 14760,
"step_time": 6.795803258207161
},
{
"clip_ratio/high_max": 5.091848506708629e-05,
"clip_ratio/high_mean": 6.364810633385787e-06,
"clip_ratio/low_mean": 2.156746950277011e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 8.521557629137532e-06,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1213.8,
"completions/max_terminated_length": 905.5,
"completions/mean_length": 163.43125,
"completions/mean_terminated_length": 150.22775573730468,
"completions/min_length": 70.9,
"completions/min_terminated_length": 70.9,
"entropy": 0.037467407318763433,
"epoch": 31.62740899357602,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.523100000000001e-06,
"loss": -0.0061,
"num_tokens": 1448265032.0,
"reward": 1.0561914324760437,
"reward_std": 0.14760990738868712,
"rewards/reward_accuracy/mean": 0.956640625,
"rewards/reward_accuracy/std": 0.14640685245394708,
"rewards/reward_format/mean": 0.09955078288912773,
"rewards/reward_format/std": 0.0031680282205343246,
"sampling/importance_sampling_ratio/max": 2.5216117978096007,
"sampling/importance_sampling_ratio/mean": 0.9825325846672058,
"sampling/importance_sampling_ratio/min": 0.16252673119306565,
"sampling/sampling_logp_difference/max": 1.1148612260818482,
"sampling/sampling_logp_difference/mean": 0.0037834556540474297,
"step": 14770,
"step_time": 5.9730117606144635
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 755.2,
"completions/max_terminated_length": 548.2,
"completions/mean_length": 135.237890625,
"completions/mean_terminated_length": 133.0065475463867,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.031224460015073417,
"epoch": 31.64882226980728,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.522100000000001e-06,
"loss": 0.0005,
"num_tokens": 1449130057.0,
"reward": 1.0780859589576721,
"reward_std": 0.11155148297548294,
"rewards/reward_accuracy/mean": 0.978125,
"rewards/reward_accuracy/std": 0.11136658638715743,
"rewards/reward_format/mean": 0.0999609388411045,
"rewards/reward_format/std": 0.0006250000558793544,
"sampling/importance_sampling_ratio/max": 2.3851337790489198,
"sampling/importance_sampling_ratio/mean": 0.9977000594139099,
"sampling/importance_sampling_ratio/min": 0.19313232675194741,
"sampling/sampling_logp_difference/max": 1.2368520081043244,
"sampling/sampling_logp_difference/mean": 0.003545845905318856,
"step": 14780,
"step_time": 4.00567868789949
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 688.2,
"completions/max_terminated_length": 462.1,
"completions/mean_length": 129.938671875,
"completions/mean_terminated_length": 128.45176544189454,
"completions/min_length": 63.5,
"completions/min_terminated_length": 63.5,
"entropy": 0.030875736847519875,
"epoch": 31.670235546038544,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.0,
"learning_rate": 8.5211e-06,
"loss": -0.0021,
"num_tokens": 1449976828.0,
"reward": 1.0835742473602294,
"reward_std": 0.07509848773479462,
"rewards/reward_accuracy/mean": 0.98359375,
"rewards/reward_accuracy/std": 0.07503133341670036,
"rewards/reward_format/mean": 0.09998046979308128,
"rewards/reward_format/std": 0.0003125000046566129,
"sampling/importance_sampling_ratio/max": 2.408078503608704,
"sampling/importance_sampling_ratio/mean": 0.9966578722000122,
"sampling/importance_sampling_ratio/min": 0.1400563722476363,
"sampling/sampling_logp_difference/max": 0.8719683051109314,
"sampling/sampling_logp_difference/mean": 0.003544735279865563,
"step": 14790,
"step_time": 3.651573937194189
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1573.7,
"completions/max_terminated_length": 1281.1,
"completions/mean_length": 166.340625,
"completions/mean_terminated_length": 158.98761901855468,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.041352284816093744,
"epoch": 31.69164882226981,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0888671875,
"learning_rate": 8.520100000000002e-06,
"loss": -0.005,
"num_tokens": 1450924116.0,
"reward": 1.0763672113418579,
"reward_std": 0.1306396298110485,
"rewards/reward_accuracy/mean": 0.9765625,
"rewards/reward_accuracy/std": 0.12914467006921768,
"rewards/reward_format/mean": 0.09980468899011612,
"rewards/reward_format/std": 0.002398134325630963,
"sampling/importance_sampling_ratio/max": 2.439843940734863,
"sampling/importance_sampling_ratio/mean": 0.9894351363182068,
"sampling/importance_sampling_ratio/min": 0.12367985025048256,
"sampling/sampling_logp_difference/max": 1.0297227382659913,
"sampling/sampling_logp_difference/mean": 0.003846147353760898,
"step": 14800,
"step_time": 7.650747406895971
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 975.4,
"completions/max_terminated_length": 950.0,
"completions/mean_length": 150.099609375,
"completions/mean_terminated_length": 144.23769836425782,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.03633915723767132,
"epoch": 31.71306209850107,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.5191e-06,
"loss": -0.003,
"num_tokens": 1451816291.0,
"reward": 1.0677344083786011,
"reward_std": 0.1460917167365551,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.1449730671942234,
"rewards/reward_format/mean": 0.09976562708616257,
"rewards/reward_format/std": 0.0022832523100078106,
"sampling/importance_sampling_ratio/max": 2.368962752819061,
"sampling/importance_sampling_ratio/mean": 0.9898596823215484,
"sampling/importance_sampling_ratio/min": 0.1563183680176735,
"sampling/sampling_logp_difference/max": 0.9824113965034484,
"sampling/sampling_logp_difference/mean": 0.0038422230631113053,
"step": 14810,
"step_time": 5.0534887067857195
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1060.8,
"completions/max_terminated_length": 754.4,
"completions/mean_length": 152.99140625,
"completions/mean_terminated_length": 141.96544952392577,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.037088018865324555,
"epoch": 31.734475374732334,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.51953125,
"learning_rate": 8.5181e-06,
"loss": -0.0006,
"num_tokens": 1452726317.0,
"reward": 1.0753320574760437,
"reward_std": 0.10431017652153969,
"rewards/reward_accuracy/mean": 0.97578125,
"rewards/reward_accuracy/std": 0.10198963657021523,
"rewards/reward_format/mean": 0.09955078288912773,
"rewards/reward_format/std": 0.003040002495981753,
"sampling/importance_sampling_ratio/max": 2.564653491973877,
"sampling/importance_sampling_ratio/mean": 0.9912839531898499,
"sampling/importance_sampling_ratio/min": 0.1250743694603443,
"sampling/sampling_logp_difference/max": 1.258508664369583,
"sampling/sampling_logp_difference/mean": 0.0038536913692951203,
"step": 14820,
"step_time": 5.405504616699181
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1153.8,
"completions/max_terminated_length": 824.6,
"completions/mean_length": 156.608984375,
"completions/mean_terminated_length": 150.71151275634764,
"completions/min_length": 70.6,
"completions/min_terminated_length": 70.6,
"entropy": 0.03746920770499855,
"epoch": 31.7558886509636,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.5171e-06,
"loss": -0.01,
"num_tokens": 1453650212.0,
"reward": 1.0743554830551147,
"reward_std": 0.12251449525356292,
"rewards/reward_accuracy/mean": 0.974609375,
"rewards/reward_accuracy/std": 0.12074178606271743,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.0030663751531392336,
"sampling/importance_sampling_ratio/max": 2.4845930218696592,
"sampling/importance_sampling_ratio/mean": 0.9907613396644592,
"sampling/importance_sampling_ratio/min": 0.1595868781208992,
"sampling/sampling_logp_difference/max": 0.9008425891399383,
"sampling/sampling_logp_difference/mean": 0.0036834746599197386,
"step": 14830,
"step_time": 5.58923991479387
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 913.2,
"completions/max_terminated_length": 734.8,
"completions/mean_length": 137.345703125,
"completions/mean_terminated_length": 136.60191345214844,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.0328524834709242,
"epoch": 31.77730192719486,
"frac_reward_zero_std": 0.95,
"grad_norm": 1.1015625,
"learning_rate": 8.5161e-06,
"loss": -0.0011,
"num_tokens": 1454517145.0,
"reward": 1.0929297089576722,
"reward_std": 0.06195746883749962,
"rewards/reward_accuracy/mean": 0.99296875,
"rewards/reward_accuracy/std": 0.06133247092366219,
"rewards/reward_format/mean": 0.0999609388411045,
"rewards/reward_format/std": 0.0006250000558793544,
"sampling/importance_sampling_ratio/max": 2.3566166520118714,
"sampling/importance_sampling_ratio/mean": 0.9938568711280823,
"sampling/importance_sampling_ratio/min": 0.11025267653167248,
"sampling/sampling_logp_difference/max": 0.8908377707004547,
"sampling/sampling_logp_difference/mean": 0.0036982923978939653,
"step": 14840,
"step_time": 4.6118272091029215
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1189.1,
"completions/max_terminated_length": 941.2,
"completions/mean_length": 155.857421875,
"completions/mean_terminated_length": 149.22373657226564,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.03434008716139943,
"epoch": 31.798715203426124,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.32421875,
"learning_rate": 8.515100000000001e-06,
"loss": -0.0075,
"num_tokens": 1455425916.0,
"reward": 1.0688086152076721,
"reward_std": 0.1332020454108715,
"rewards/reward_accuracy/mean": 0.969140625,
"rewards/reward_accuracy/std": 0.13190364763140677,
"rewards/reward_format/mean": 0.09966796934604645,
"rewards/reward_format/std": 0.003334212489426136,
"sampling/importance_sampling_ratio/max": 2.410148096084595,
"sampling/importance_sampling_ratio/mean": 0.9933686256408691,
"sampling/importance_sampling_ratio/min": 0.1593768835067749,
"sampling/sampling_logp_difference/max": 1.0335906744003296,
"sampling/sampling_logp_difference/mean": 0.0035198803758248686,
"step": 14850,
"step_time": 5.787000390098546
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1252.4,
"completions/max_terminated_length": 998.4,
"completions/mean_length": 148.1359375,
"completions/mean_terminated_length": 144.42149200439454,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.03711564266122878,
"epoch": 31.820128479657388,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.333984375,
"learning_rate": 8.5141e-06,
"loss": -0.0002,
"num_tokens": 1456320744.0,
"reward": 1.0663476586341858,
"reward_std": 0.14201294332742692,
"rewards/reward_accuracy/mean": 0.96640625,
"rewards/reward_accuracy/std": 0.14178462624549865,
"rewards/reward_format/mean": 0.09994140639901161,
"rewards/reward_format/std": 0.0009375000139698386,
"sampling/importance_sampling_ratio/max": 2.4280987858772276,
"sampling/importance_sampling_ratio/mean": 0.9835132718086242,
"sampling/importance_sampling_ratio/min": 0.1567633755505085,
"sampling/sampling_logp_difference/max": 0.9788933396339417,
"sampling/sampling_logp_difference/mean": 0.00385088799521327,
"step": 14860,
"step_time": 6.154394888208481
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0109375,
"completions/max_length": 1671.6,
"completions/max_terminated_length": 1009.7,
"completions/mean_length": 163.093359375,
"completions/mean_terminated_length": 142.32928543090821,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.039823967637494205,
"epoch": 31.841541755888652,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.15234375,
"learning_rate": 8.513100000000002e-06,
"loss": -0.0037,
"num_tokens": 1457251399.0,
"reward": 1.0551953256130218,
"reward_std": 0.17518158331513406,
"rewards/reward_accuracy/mean": 0.955859375,
"rewards/reward_accuracy/std": 0.1717665061354637,
"rewards/reward_format/mean": 0.09933593794703484,
"rewards/reward_format/std": 0.006166409398429096,
"sampling/importance_sampling_ratio/max": 2.659245562553406,
"sampling/importance_sampling_ratio/mean": 0.9864839732646942,
"sampling/importance_sampling_ratio/min": 0.08218387262895703,
"sampling/sampling_logp_difference/max": 1.1007038712501527,
"sampling/sampling_logp_difference/mean": 0.003951135417446494,
"step": 14870,
"step_time": 8.063844294205774
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1132.7,
"completions/max_terminated_length": 915.3,
"completions/mean_length": 148.238671875,
"completions/mean_terminated_length": 143.8244369506836,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.035486059240065516,
"epoch": 31.862955032119913,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.255859375,
"learning_rate": 8.512100000000001e-06,
"loss": -0.0061,
"num_tokens": 1458150250.0,
"reward": 1.0744922161102295,
"reward_std": 0.12300103902816772,
"rewards/reward_accuracy/mean": 0.974609375,
"rewards/reward_accuracy/std": 0.12239512652158738,
"rewards/reward_format/mean": 0.09988281428813935,
"rewards/reward_format/std": 0.001387959998100996,
"sampling/importance_sampling_ratio/max": 2.372790789604187,
"sampling/importance_sampling_ratio/mean": 0.9878783106803894,
"sampling/importance_sampling_ratio/min": 0.08341474495828152,
"sampling/sampling_logp_difference/max": 0.9976695537567138,
"sampling/sampling_logp_difference/mean": 0.0037142841378226877,
"step": 14880,
"step_time": 5.736107476608595
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1142.2,
"completions/max_terminated_length": 1135.5,
"completions/mean_length": 162.638671875,
"completions/mean_terminated_length": 150.95650329589844,
"completions/min_length": 61.2,
"completions/min_terminated_length": 61.2,
"entropy": 0.039856042829342186,
"epoch": 31.884368308351178,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.0,
"learning_rate": 8.5111e-06,
"loss": -0.0007,
"num_tokens": 1459087165.0,
"reward": 1.0557617366313934,
"reward_std": 0.16197027743328363,
"rewards/reward_accuracy/mean": 0.95625,
"rewards/reward_accuracy/std": 0.15993321388959886,
"rewards/reward_format/mean": 0.09951172024011612,
"rewards/reward_format/std": 0.0035254548070952295,
"sampling/importance_sampling_ratio/max": 2.460556423664093,
"sampling/importance_sampling_ratio/mean": 0.9890987932682037,
"sampling/importance_sampling_ratio/min": 0.09815075248479843,
"sampling/sampling_logp_difference/max": 1.0763937950134277,
"sampling/sampling_logp_difference/mean": 0.003708662395365536,
"step": 14890,
"step_time": 5.7678498457011305
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 876.1,
"completions/max_terminated_length": 683.1,
"completions/mean_length": 151.74140625,
"completions/mean_terminated_length": 146.62962341308594,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"entropy": 0.03610718541312963,
"epoch": 31.905781584582442,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.30859375,
"learning_rate": 8.510100000000002e-06,
"loss": 0.0027,
"num_tokens": 1459996279.0,
"reward": 1.077929711341858,
"reward_std": 0.09640606939792633,
"rewards/reward_accuracy/mean": 0.978125,
"rewards/reward_accuracy/std": 0.09574450701475143,
"rewards/reward_format/mean": 0.09980468899011612,
"rewards/reward_format/std": 0.0016836996655911207,
"sampling/importance_sampling_ratio/max": 2.504521894454956,
"sampling/importance_sampling_ratio/mean": 0.9968731999397278,
"sampling/importance_sampling_ratio/min": 0.17793384790420533,
"sampling/sampling_logp_difference/max": 0.8135426282882691,
"sampling/sampling_logp_difference/mean": 0.0037046227138489486,
"step": 14900,
"step_time": 4.5692169579939215
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1343.4,
"completions/max_terminated_length": 1045.6,
"completions/mean_length": 167.1984375,
"completions/mean_terminated_length": 153.41667938232422,
"completions/min_length": 67.7,
"completions/min_terminated_length": 67.7,
"entropy": 0.042883167741820216,
"epoch": 31.927194860813703,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.177734375,
"learning_rate": 8.509100000000001e-06,
"loss": -0.0028,
"num_tokens": 1460944739.0,
"reward": 1.0643945395946504,
"reward_std": 0.14314212575554847,
"rewards/reward_accuracy/mean": 0.96484375,
"rewards/reward_accuracy/std": 0.14154978916049005,
"rewards/reward_format/mean": 0.09955078214406968,
"rewards/reward_format/std": 0.0038428531493991613,
"sampling/importance_sampling_ratio/max": 2.5006950974464415,
"sampling/importance_sampling_ratio/mean": 0.9852002739906311,
"sampling/importance_sampling_ratio/min": 0.12245299313217402,
"sampling/sampling_logp_difference/max": 0.905967366695404,
"sampling/sampling_logp_difference/mean": 0.003979846695438027,
"step": 14910,
"step_time": 6.771594164703856
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 993.8,
"completions/max_terminated_length": 897.6,
"completions/mean_length": 151.421484375,
"completions/mean_terminated_length": 147.05479431152344,
"completions/min_length": 63.1,
"completions/min_terminated_length": 63.1,
"entropy": 0.03821591839659959,
"epoch": 31.948608137044967,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.2333984375,
"learning_rate": 8.5081e-06,
"loss": -0.0052,
"num_tokens": 1461848586.0,
"reward": 1.0915429830551147,
"reward_std": 0.060783660411834715,
"rewards/reward_accuracy/mean": 0.991796875,
"rewards/reward_accuracy/std": 0.05946628451347351,
"rewards/reward_format/mean": 0.09974609389901161,
"rewards/reward_format/std": 0.0023240381153300403,
"sampling/importance_sampling_ratio/max": 2.3888060212135316,
"sampling/importance_sampling_ratio/mean": 0.9872592985630035,
"sampling/importance_sampling_ratio/min": 0.17441023662686347,
"sampling/sampling_logp_difference/max": 0.9966249465942383,
"sampling/sampling_logp_difference/mean": 0.0036869045346975327,
"step": 14920,
"step_time": 4.996814598303172
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1062.4,
"completions/max_terminated_length": 1013.7,
"completions/mean_length": 146.103515625,
"completions/mean_terminated_length": 143.90928955078124,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.03385720159858465,
"epoch": 31.970021413276232,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.5071e-06,
"loss": -0.0063,
"num_tokens": 1462737507.0,
"reward": 1.0459375023841857,
"reward_std": 0.1860494814813137,
"rewards/reward_accuracy/mean": 0.94609375,
"rewards/reward_accuracy/std": 0.18525404632091522,
"rewards/reward_format/mean": 0.09984375089406967,
"rewards/reward_format/std": 0.0021321488078683616,
"sampling/importance_sampling_ratio/max": 2.3183075308799745,
"sampling/importance_sampling_ratio/mean": 0.9862264513969421,
"sampling/importance_sampling_ratio/min": 0.1084387719631195,
"sampling/sampling_logp_difference/max": 0.7735653936862945,
"sampling/sampling_logp_difference/mean": 0.003628298523835838,
"step": 14930,
"step_time": 5.248820918810088
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1585.0,
"completions/max_terminated_length": 1161.7,
"completions/mean_length": 169.090625,
"completions/mean_terminated_length": 156.68988571166992,
"completions/min_length": 67.2,
"completions/min_terminated_length": 67.2,
"entropy": 0.04576894536148757,
"epoch": 31.991434689507496,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.31640625,
"learning_rate": 8.5061e-06,
"loss": -0.0062,
"num_tokens": 1463690923.0,
"reward": 1.0587304890155793,
"reward_std": 0.16893045604228973,
"rewards/reward_accuracy/mean": 0.959375,
"rewards/reward_accuracy/std": 0.165758103877306,
"rewards/reward_format/mean": 0.09935547038912773,
"rewards/reward_format/std": 0.006099873711355031,
"sampling/importance_sampling_ratio/max": 2.5018293142318724,
"sampling/importance_sampling_ratio/mean": 0.9948447704315185,
"sampling/importance_sampling_ratio/min": 0.108500312641263,
"sampling/sampling_logp_difference/max": 1.118441289663315,
"sampling/sampling_logp_difference/mean": 0.004050096101127565,
"step": 14940,
"step_time": 7.616310878103832
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1190.5,
"completions/max_terminated_length": 940.5,
"completions/mean_length": 154.19609375,
"completions/mean_terminated_length": 144.60600738525392,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"entropy": 0.03867314555682242,
"epoch": 32.01284796573876,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.69921875,
"learning_rate": 8.505100000000001e-06,
"loss": -0.0015,
"num_tokens": 1464600817.0,
"reward": 1.07066410779953,
"reward_std": 0.14021532535552977,
"rewards/reward_accuracy/mean": 0.97109375,
"rewards/reward_accuracy/std": 0.13835152685642244,
"rewards/reward_format/mean": 0.09957031533122063,
"rewards/reward_format/std": 0.0033983222208917143,
"sampling/importance_sampling_ratio/max": 2.578583288192749,
"sampling/importance_sampling_ratio/mean": 0.9893185913562774,
"sampling/importance_sampling_ratio/min": 0.078243513032794,
"sampling/sampling_logp_difference/max": 1.1785414576530457,
"sampling/sampling_logp_difference/mean": 0.004083247412927449,
"step": 14950,
"step_time": 5.845286836801097
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1305.0,
"completions/max_terminated_length": 1238.9,
"completions/mean_length": 170.1,
"completions/mean_terminated_length": 156.95433044433594,
"completions/min_length": 66.3,
"completions/min_terminated_length": 66.3,
"entropy": 0.04164734953083098,
"epoch": 32.03426124197002,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.224609375,
"learning_rate": 8.5041e-06,
"loss": -0.0092,
"num_tokens": 1465555713.0,
"reward": 1.059628927707672,
"reward_std": 0.16119444519281387,
"rewards/reward_accuracy/mean": 0.96015625,
"rewards/reward_accuracy/std": 0.1591213010251522,
"rewards/reward_format/mean": 0.09947265684604645,
"rewards/reward_format/std": 0.0038210672326385977,
"sampling/importance_sampling_ratio/max": 2.4970685958862306,
"sampling/importance_sampling_ratio/mean": 0.9819199979305268,
"sampling/importance_sampling_ratio/min": 0.08141536936163903,
"sampling/sampling_logp_difference/max": 1.3003840923309327,
"sampling/sampling_logp_difference/mean": 0.004159195395186543,
"step": 14960,
"step_time": 6.606145804506378
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1030.7,
"completions/max_terminated_length": 900.7,
"completions/mean_length": 157.049609375,
"completions/mean_terminated_length": 146.87604675292968,
"completions/min_length": 62.0,
"completions/min_terminated_length": 62.0,
"entropy": 0.04202926310244948,
"epoch": 32.055674518201286,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.5031e-06,
"loss": -0.006,
"num_tokens": 1466476352.0,
"reward": 1.074609398841858,
"reward_std": 0.10781847313046455,
"rewards/reward_accuracy/mean": 0.975,
"rewards/reward_accuracy/std": 0.106093118339777,
"rewards/reward_format/mean": 0.09960937649011611,
"rewards/reward_format/std": 0.003128172550350428,
"sampling/importance_sampling_ratio/max": 2.4818204164505007,
"sampling/importance_sampling_ratio/mean": 0.9857363760471344,
"sampling/importance_sampling_ratio/min": 0.1247762992978096,
"sampling/sampling_logp_difference/max": 1.0524136900901795,
"sampling/sampling_logp_difference/mean": 0.003895054361782968,
"step": 14970,
"step_time": 5.442828903099871
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1451.4,
"completions/max_terminated_length": 1403.4,
"completions/mean_length": 158.03828125,
"completions/mean_terminated_length": 148.5005661010742,
"completions/min_length": 67.7,
"completions/min_terminated_length": 67.7,
"entropy": 0.03709569664206356,
"epoch": 32.07708779443255,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.502100000000001e-06,
"loss": -0.0085,
"num_tokens": 1467402082.0,
"reward": 1.0734375357627868,
"reward_std": 0.12447535172104836,
"rewards/reward_accuracy/mean": 0.973828125,
"rewards/reward_accuracy/std": 0.12286859676241875,
"rewards/reward_format/mean": 0.09960937723517418,
"rewards/reward_format/std": 0.003029373474419117,
"sampling/importance_sampling_ratio/max": 2.539838719367981,
"sampling/importance_sampling_ratio/mean": 0.9801316797733307,
"sampling/importance_sampling_ratio/min": 0.05487128049135208,
"sampling/sampling_logp_difference/max": 1.1306152164936065,
"sampling/sampling_logp_difference/mean": 0.003843037132173777,
"step": 14980,
"step_time": 7.105406770497211
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1289.9,
"completions/max_terminated_length": 1123.8,
"completions/mean_length": 170.93359375,
"completions/mean_terminated_length": 154.81078033447267,
"completions/min_length": 60.9,
"completions/min_terminated_length": 60.9,
"entropy": 0.038643663330003616,
"epoch": 32.098501070663815,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.2490234375,
"learning_rate": 8.5011e-06,
"loss": -0.005,
"num_tokens": 1468363736.0,
"reward": 1.075292992591858,
"reward_std": 0.11339533478021621,
"rewards/reward_accuracy/mean": 0.97578125,
"rewards/reward_accuracy/std": 0.1110015481710434,
"rewards/reward_format/mean": 0.09951172098517418,
"rewards/reward_format/std": 0.0036208396777510643,
"sampling/importance_sampling_ratio/max": 2.536261558532715,
"sampling/importance_sampling_ratio/mean": 0.9816598892211914,
"sampling/importance_sampling_ratio/min": 0.12029192745685577,
"sampling/sampling_logp_difference/max": 1.0784489572048188,
"sampling/sampling_logp_difference/mean": 0.0035862349905073643,
"step": 14990,
"step_time": 6.4186357164056975
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1427.6,
"completions/max_terminated_length": 1134.1,
"completions/mean_length": 163.7171875,
"completions/mean_terminated_length": 160.0257141113281,
"completions/min_length": 67.5,
"completions/min_terminated_length": 67.5,
"entropy": 0.04275866146199405,
"epoch": 32.11991434689507,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.478515625,
"learning_rate": 8.500100000000002e-06,
"loss": -0.0012,
"num_tokens": 1469311700.0,
"reward": 1.070507824420929,
"reward_std": 0.12528944239020348,
"rewards/reward_accuracy/mean": 0.970703125,
"rewards/reward_accuracy/std": 0.12447534576058387,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.0020718434127047656,
"sampling/importance_sampling_ratio/max": 2.438786232471466,
"sampling/importance_sampling_ratio/mean": 0.9859391152858734,
"sampling/importance_sampling_ratio/min": 0.05016997903585434,
"sampling/sampling_logp_difference/max": 1.020617461204529,
"sampling/sampling_logp_difference/mean": 0.003968309657648206,
"step": 15000,
"step_time": 6.966543590312358
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1360.1,
"completions/max_terminated_length": 1141.9,
"completions/mean_length": 156.109375,
"completions/mean_terminated_length": 150.21336669921874,
"completions/min_length": 67.7,
"completions/min_terminated_length": 67.7,
"entropy": 0.04119085532147437,
"epoch": 32.14132762312634,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.19140625,
"learning_rate": 8.499100000000001e-06,
"loss": -0.0086,
"num_tokens": 1470229548.0,
"reward": 1.0697461187839508,
"reward_std": 0.1416443757712841,
"rewards/reward_accuracy/mean": 0.969921875,
"rewards/reward_accuracy/std": 0.14013767167925834,
"rewards/reward_format/mean": 0.0998242199420929,
"rewards/reward_format/std": 0.0022607231279835106,
"sampling/importance_sampling_ratio/max": 2.5695250153541567,
"sampling/importance_sampling_ratio/mean": 0.9799460768699646,
"sampling/importance_sampling_ratio/min": 0.11666427627205848,
"sampling/sampling_logp_difference/max": 1.0334583044052124,
"sampling/sampling_logp_difference/mean": 0.004111215099692344,
"step": 15010,
"step_time": 6.36548008248792
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1263.5,
"completions/max_terminated_length": 1153.9,
"completions/mean_length": 162.1109375,
"completions/mean_terminated_length": 153.31731109619142,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"entropy": 0.036614530626684426,
"epoch": 32.1627408993576,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.0,
"learning_rate": 8.498100000000001e-06,
"loss": -0.0041,
"num_tokens": 1471168952.0,
"reward": 1.0769922018051148,
"reward_std": 0.11268405392765998,
"rewards/reward_accuracy/mean": 0.97734375,
"rewards/reward_accuracy/std": 0.11085866615176201,
"rewards/reward_format/mean": 0.09964843839406967,
"rewards/reward_format/std": 0.0035709035582840443,
"sampling/importance_sampling_ratio/max": 2.43343300819397,
"sampling/importance_sampling_ratio/mean": 0.9911847770214081,
"sampling/importance_sampling_ratio/min": 0.19121461734175682,
"sampling/sampling_logp_difference/max": 1.2458908319473267,
"sampling/sampling_logp_difference/mean": 0.003699503280222416,
"step": 15020,
"step_time": 6.258799441988231
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 943.0,
"completions/max_terminated_length": 710.0,
"completions/mean_length": 153.060546875,
"completions/mean_terminated_length": 150.82333374023438,
"completions/min_length": 64.4,
"completions/min_terminated_length": 64.4,
"entropy": 0.037966274586506185,
"epoch": 32.184154175588866,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.228515625,
"learning_rate": 8.4971e-06,
"loss": -0.0054,
"num_tokens": 1472088211.0,
"reward": 1.0757031321525574,
"reward_std": 0.09800993874669076,
"rewards/reward_accuracy/mean": 0.97578125,
"rewards/reward_accuracy/std": 0.09724199324846268,
"rewards/reward_format/mean": 0.09992187544703483,
"rewards/reward_format/std": 0.0012500000651925803,
"sampling/importance_sampling_ratio/max": 2.4720186471939085,
"sampling/importance_sampling_ratio/mean": 0.9913776040077209,
"sampling/importance_sampling_ratio/min": 0.11726858913898468,
"sampling/sampling_logp_difference/max": 1.1257975578308106,
"sampling/sampling_logp_difference/mean": 0.0040051921736449,
"step": 15030,
"step_time": 4.930224724597065
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 961.9,
"completions/max_terminated_length": 938.5,
"completions/mean_length": 155.33203125,
"completions/mean_terminated_length": 144.3095947265625,
"completions/min_length": 68.1,
"completions/min_terminated_length": 68.1,
"entropy": 0.03819172086659819,
"epoch": 32.20556745182013,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.2294921875,
"learning_rate": 8.4961e-06,
"loss": -0.0001,
"num_tokens": 1473002341.0,
"reward": 1.076425802707672,
"reward_std": 0.09884055256843567,
"rewards/reward_accuracy/mean": 0.976953125,
"rewards/reward_accuracy/std": 0.09685125648975372,
"rewards/reward_format/mean": 0.0994726575911045,
"rewards/reward_format/std": 0.0029172270558774473,
"sampling/importance_sampling_ratio/max": 2.4935776233673095,
"sampling/importance_sampling_ratio/mean": 0.9963552534580231,
"sampling/importance_sampling_ratio/min": 0.25097215473651885,
"sampling/sampling_logp_difference/max": 0.9917688250541687,
"sampling/sampling_logp_difference/mean": 0.003926735348068177,
"step": 15040,
"step_time": 5.049076426000101
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 821.7,
"completions/max_terminated_length": 744.7,
"completions/mean_length": 155.414453125,
"completions/mean_terminated_length": 143.87588958740236,
"completions/min_length": 62.2,
"completions/min_terminated_length": 62.2,
"entropy": 0.03550848276354372,
"epoch": 32.226980728051394,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0,
"learning_rate": 8.495100000000001e-06,
"loss": -0.0032,
"num_tokens": 1473914490.0,
"reward": 1.0608789205551148,
"reward_std": 0.14445207566022872,
"rewards/reward_accuracy/mean": 0.961328125,
"rewards/reward_accuracy/std": 0.1430625334382057,
"rewards/reward_format/mean": 0.09955078214406968,
"rewards/reward_format/std": 0.0028459371067583563,
"sampling/importance_sampling_ratio/max": 2.403583037853241,
"sampling/importance_sampling_ratio/mean": 0.9899538040161133,
"sampling/importance_sampling_ratio/min": 0.21518708746880294,
"sampling/sampling_logp_difference/max": 1.0351561427116394,
"sampling/sampling_logp_difference/mean": 0.003643289860337973,
"step": 15050,
"step_time": 4.61134499219479
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1140.4,
"completions/max_terminated_length": 872.2,
"completions/mean_length": 153.118359375,
"completions/mean_terminated_length": 148.67119445800782,
"completions/min_length": 68.3,
"completions/min_terminated_length": 68.3,
"entropy": 0.03626874811016023,
"epoch": 32.24839400428265,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.08203125,
"learning_rate": 8.4941e-06,
"loss": -0.0097,
"num_tokens": 1474821881.0,
"reward": 1.069394552707672,
"reward_std": 0.13973613157868386,
"rewards/reward_accuracy/mean": 0.96953125,
"rewards/reward_accuracy/std": 0.13916807621717453,
"rewards/reward_format/mean": 0.09986328259110451,
"rewards/reward_format/std": 0.0018196487100794912,
"sampling/importance_sampling_ratio/max": 2.5295819997787476,
"sampling/importance_sampling_ratio/mean": 0.9890917301177978,
"sampling/importance_sampling_ratio/min": 0.04468413218855858,
"sampling/sampling_logp_difference/max": 0.9458189010620117,
"sampling/sampling_logp_difference/mean": 0.003789612022228539,
"step": 15060,
"step_time": 5.520926315587713
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1333.5,
"completions/max_terminated_length": 1029.3,
"completions/mean_length": 146.457421875,
"completions/mean_terminated_length": 141.98082885742187,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.04107818850316107,
"epoch": 32.269807280513916,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.1396484375,
"learning_rate": 8.4931e-06,
"loss": -0.0082,
"num_tokens": 1475715580.0,
"reward": 1.0725586056709289,
"reward_std": 0.13443865180015563,
"rewards/reward_accuracy/mean": 0.97265625,
"rewards/reward_accuracy/std": 0.13391047790646554,
"rewards/reward_format/mean": 0.09990234449505805,
"rewards/reward_format/std": 0.0013785743853077293,
"sampling/importance_sampling_ratio/max": 2.361822760105133,
"sampling/importance_sampling_ratio/mean": 0.9956988394260406,
"sampling/importance_sampling_ratio/min": 0.11241634003818035,
"sampling/sampling_logp_difference/max": 0.9776203632354736,
"sampling/sampling_logp_difference/mean": 0.0040924749337136745,
"step": 15070,
"step_time": 6.293805586497183
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1079.7,
"completions/max_terminated_length": 956.6,
"completions/mean_length": 149.11953125,
"completions/mean_terminated_length": 145.43084869384765,
"completions/min_length": 62.7,
"completions/min_terminated_length": 62.7,
"entropy": 0.03457401010673493,
"epoch": 32.29122055674518,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.0751953125,
"learning_rate": 8.492100000000001e-06,
"loss": -0.0035,
"num_tokens": 1476610302.0,
"reward": 1.058496105670929,
"reward_std": 0.15605363622307777,
"rewards/reward_accuracy/mean": 0.95859375,
"rewards/reward_accuracy/std": 0.1553635336458683,
"rewards/reward_format/mean": 0.09990234449505805,
"rewards/reward_format/std": 0.0013785744318738579,
"sampling/importance_sampling_ratio/max": 2.526549768447876,
"sampling/importance_sampling_ratio/mean": 0.9989199876785279,
"sampling/importance_sampling_ratio/min": 0.1935075655579567,
"sampling/sampling_logp_difference/max": 1.022071397304535,
"sampling/sampling_logp_difference/mean": 0.0036891983589157464,
"step": 15080,
"step_time": 5.461002961805207
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1013.9,
"completions/max_terminated_length": 790.7,
"completions/mean_length": 152.789453125,
"completions/mean_terminated_length": 144.7552917480469,
"completions/min_length": 64.4,
"completions/min_terminated_length": 64.4,
"entropy": 0.037844337872229517,
"epoch": 32.312633832976445,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.4911e-06,
"loss": 0.0013,
"num_tokens": 1477515459.0,
"reward": 1.0868359565734864,
"reward_std": 0.07527909576892852,
"rewards/reward_accuracy/mean": 0.987109375,
"rewards/reward_accuracy/std": 0.07380942702293396,
"rewards/reward_format/mean": 0.09972656294703483,
"rewards/reward_format/std": 0.0024859577417373655,
"sampling/importance_sampling_ratio/max": 2.389561951160431,
"sampling/importance_sampling_ratio/mean": 0.9888874530792237,
"sampling/importance_sampling_ratio/min": 0.17517341673374176,
"sampling/sampling_logp_difference/max": 0.9232089996337891,
"sampling/sampling_logp_difference/mean": 0.003781500784680247,
"step": 15090,
"step_time": 5.169360955993762
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1509.2,
"completions/max_terminated_length": 1040.7,
"completions/mean_length": 152.0609375,
"completions/mean_terminated_length": 141.6507766723633,
"completions/min_length": 59.7,
"completions/min_terminated_length": 59.7,
"entropy": 0.041733550489880145,
"epoch": 32.33404710920771,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.490100000000002e-06,
"loss": -0.0112,
"num_tokens": 1478418895.0,
"reward": 1.0687695384025573,
"reward_std": 0.13510300666093827,
"rewards/reward_accuracy/mean": 0.969140625,
"rewards/reward_accuracy/std": 0.133123180270195,
"rewards/reward_format/mean": 0.09962890669703484,
"rewards/reward_format/std": 0.003336334344930947,
"sampling/importance_sampling_ratio/max": 2.5250030755996704,
"sampling/importance_sampling_ratio/mean": 0.9935706377029419,
"sampling/importance_sampling_ratio/min": 0.06661339402198792,
"sampling/sampling_logp_difference/max": 1.0870628952980042,
"sampling/sampling_logp_difference/mean": 0.004109868011437356,
"step": 15100,
"step_time": 7.226348568801768
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1117.9,
"completions/max_terminated_length": 822.9,
"completions/mean_length": 149.530078125,
"completions/mean_terminated_length": 145.1213394165039,
"completions/min_length": 65.3,
"completions/min_terminated_length": 65.3,
"entropy": 0.033021943154744805,
"epoch": 32.355460385438974,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.48828125,
"learning_rate": 8.489100000000001e-06,
"loss": -0.0052,
"num_tokens": 1479319228.0,
"reward": 1.0713281512260437,
"reward_std": 0.13113174736499786,
"rewards/reward_accuracy/mean": 0.971484375,
"rewards/reward_accuracy/std": 0.12997530102729798,
"rewards/reward_format/mean": 0.09984375163912773,
"rewards/reward_format/std": 0.00213214885443449,
"sampling/importance_sampling_ratio/max": 2.3040297985076905,
"sampling/importance_sampling_ratio/mean": 0.9849774599075317,
"sampling/importance_sampling_ratio/min": 0.21996488198637962,
"sampling/sampling_logp_difference/max": 0.8271182715892792,
"sampling/sampling_logp_difference/mean": 0.003544457466341555,
"step": 15110,
"step_time": 5.604653238606988
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 956.2,
"completions/max_terminated_length": 945.8,
"completions/mean_length": 139.7359375,
"completions/mean_terminated_length": 138.2746551513672,
"completions/min_length": 61.2,
"completions/min_terminated_length": 61.2,
"entropy": 0.03238790475297719,
"epoch": 32.37687366167024,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.488100000000001e-06,
"loss": -0.0024,
"num_tokens": 1480191512.0,
"reward": 1.0831250190734862,
"reward_std": 0.10341196954250335,
"rewards/reward_accuracy/mean": 0.983203125,
"rewards/reward_accuracy/std": 0.10285507515072823,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.0010101743275299669,
"sampling/importance_sampling_ratio/max": 2.448414182662964,
"sampling/importance_sampling_ratio/mean": 0.9975358963012695,
"sampling/importance_sampling_ratio/min": 0.16872115321457387,
"sampling/sampling_logp_difference/max": 0.8446707010269165,
"sampling/sampling_logp_difference/mean": 0.0034713474102318286,
"step": 15120,
"step_time": 4.752273425116437
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1335.9,
"completions/max_terminated_length": 1156.2,
"completions/mean_length": 171.228515625,
"completions/mean_terminated_length": 155.18346557617187,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.046185734565369785,
"epoch": 32.398286937901496,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 8.4871e-06,
"loss": -0.0019,
"num_tokens": 1481146801.0,
"reward": 1.0550586223602294,
"reward_std": 0.1585914485156536,
"rewards/reward_accuracy/mean": 0.95546875,
"rewards/reward_accuracy/std": 0.1568029649555683,
"rewards/reward_format/mean": 0.09958984553813935,
"rewards/reward_format/std": 0.003702771523967385,
"sampling/importance_sampling_ratio/max": 2.4789270520210267,
"sampling/importance_sampling_ratio/mean": 0.9833700954914093,
"sampling/importance_sampling_ratio/min": 0.1334232408553362,
"sampling/sampling_logp_difference/max": 0.859230375289917,
"sampling/sampling_logp_difference/mean": 0.004027560725808144,
"step": 15130,
"step_time": 6.914646513998742
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1234.4,
"completions/max_terminated_length": 1147.6,
"completions/mean_length": 161.73125,
"completions/mean_terminated_length": 149.25611877441406,
"completions/min_length": 67.4,
"completions/min_terminated_length": 67.4,
"entropy": 0.044771532015874985,
"epoch": 32.41970021413276,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.310546875,
"learning_rate": 8.4861e-06,
"loss": -0.0049,
"num_tokens": 1482079281.0,
"reward": 1.047675794363022,
"reward_std": 0.1727794088423252,
"rewards/reward_accuracy/mean": 0.948046875,
"rewards/reward_accuracy/std": 0.17136834114789962,
"rewards/reward_format/mean": 0.09962890669703484,
"rewards/reward_format/std": 0.0034023164073005317,
"sampling/importance_sampling_ratio/max": 2.488362991809845,
"sampling/importance_sampling_ratio/mean": 0.9820115685462951,
"sampling/importance_sampling_ratio/min": 0.11798058673739434,
"sampling/sampling_logp_difference/max": 0.9973392844200134,
"sampling/sampling_logp_difference/mean": 0.004187963507138193,
"step": 15140,
"step_time": 6.325403550994816
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1519.2,
"completions/max_terminated_length": 1085.4,
"completions/mean_length": 147.46796875,
"completions/mean_terminated_length": 143.01487731933594,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.03578829823527485,
"epoch": 32.441113490364025,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.08154296875,
"learning_rate": 8.485100000000001e-06,
"loss": -0.0006,
"num_tokens": 1482974367.0,
"reward": 1.0663281321525573,
"reward_std": 0.14564185515046119,
"rewards/reward_accuracy/mean": 0.96640625,
"rewards/reward_accuracy/std": 0.14510809779167175,
"rewards/reward_format/mean": 0.09992187544703483,
"rewards/reward_format/std": 0.0012500000651925803,
"sampling/importance_sampling_ratio/max": 2.3287765741348267,
"sampling/importance_sampling_ratio/mean": 0.9899421036243439,
"sampling/importance_sampling_ratio/min": 0.12154159173369408,
"sampling/sampling_logp_difference/max": 0.938415265083313,
"sampling/sampling_logp_difference/mean": 0.0035825064638629555,
"step": 15150,
"step_time": 7.040528369203093
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 709.8,
"completions/max_terminated_length": 545.3,
"completions/mean_length": 141.872265625,
"completions/mean_terminated_length": 141.12591552734375,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.03131904574111104,
"epoch": 32.46252676659529,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.0,
"learning_rate": 8.4841e-06,
"loss": -0.0009,
"num_tokens": 1483856776.0,
"reward": 1.0902148604393005,
"reward_std": 0.06343144327402114,
"rewards/reward_accuracy/mean": 0.990234375,
"rewards/reward_accuracy/std": 0.0631189450621605,
"rewards/reward_format/mean": 0.09998046979308128,
"rewards/reward_format/std": 0.0003125000046566129,
"sampling/importance_sampling_ratio/max": 2.4720770835876467,
"sampling/importance_sampling_ratio/mean": 0.992953646183014,
"sampling/importance_sampling_ratio/min": 0.13445141389966012,
"sampling/sampling_logp_difference/max": 1.0256116151809693,
"sampling/sampling_logp_difference/mean": 0.0034864077577367427,
"step": 15160,
"step_time": 3.840326446402469
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1350.4,
"completions/max_terminated_length": 1185.2,
"completions/mean_length": 152.958203125,
"completions/mean_terminated_length": 149.2882537841797,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"entropy": 0.03690030789002776,
"epoch": 32.48394004282655,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.1826171875,
"learning_rate": 8.4831e-06,
"loss": -0.0043,
"num_tokens": 1484769181.0,
"reward": 1.050976574420929,
"reward_std": 0.17420097216963767,
"rewards/reward_accuracy/mean": 0.951171875,
"rewards/reward_accuracy/std": 0.17339904829859734,
"rewards/reward_format/mean": 0.09980468899011612,
"rewards/reward_format/std": 0.002270108601078391,
"sampling/importance_sampling_ratio/max": 2.4464163303375246,
"sampling/importance_sampling_ratio/mean": 0.9879769623279572,
"sampling/importance_sampling_ratio/min": 0.13176800757646562,
"sampling/sampling_logp_difference/max": 0.9541298031806946,
"sampling/sampling_logp_difference/mean": 0.003759062825702131,
"step": 15170,
"step_time": 6.544317215005867
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1034.4,
"completions/max_terminated_length": 860.1,
"completions/mean_length": 139.904296875,
"completions/mean_terminated_length": 136.95101470947264,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.03409593699034304,
"epoch": 32.50535331905782,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.296875,
"learning_rate": 8.482100000000001e-06,
"loss": -0.0008,
"num_tokens": 1485643720.0,
"reward": 1.0826562643051147,
"reward_std": 0.08597816780675202,
"rewards/reward_accuracy/mean": 0.9828125,
"rewards/reward_accuracy/std": 0.08505937680602074,
"rewards/reward_format/mean": 0.09984375089406967,
"rewards/reward_format/std": 0.002132148714736104,
"sampling/importance_sampling_ratio/max": 2.501770186424255,
"sampling/importance_sampling_ratio/mean": 0.9879711091518402,
"sampling/importance_sampling_ratio/min": 0.1265403863042593,
"sampling/sampling_logp_difference/max": 0.9681031823158264,
"sampling/sampling_logp_difference/mean": 0.003632461396045983,
"step": 15180,
"step_time": 5.061851918301545
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1252.0,
"completions/max_terminated_length": 1092.4,
"completions/mean_length": 151.254296875,
"completions/mean_terminated_length": 146.14284973144532,
"completions/min_length": 62.5,
"completions/min_terminated_length": 62.5,
"entropy": 0.03788953549228609,
"epoch": 32.52676659528908,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.25390625,
"learning_rate": 8.4811e-06,
"loss": -0.0043,
"num_tokens": 1486541363.0,
"reward": 1.0735937654972076,
"reward_std": 0.11263482868671418,
"rewards/reward_accuracy/mean": 0.973828125,
"rewards/reward_accuracy/std": 0.1113666608929634,
"rewards/reward_format/mean": 0.09976562559604644,
"rewards/reward_format/std": 0.0024991744896396993,
"sampling/importance_sampling_ratio/max": 2.279097092151642,
"sampling/importance_sampling_ratio/mean": 0.981550145149231,
"sampling/importance_sampling_ratio/min": 0.1714998658746481,
"sampling/sampling_logp_difference/max": 1.1353399097919463,
"sampling/sampling_logp_difference/mean": 0.0036806670716032384,
"step": 15190,
"step_time": 6.142958567201276
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1178.3,
"completions/max_terminated_length": 938.4,
"completions/mean_length": 143.900390625,
"completions/mean_terminated_length": 142.41666107177736,
"completions/min_length": 69.8,
"completions/min_terminated_length": 69.8,
"entropy": 0.03225263599306345,
"epoch": 32.54817987152034,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.2041015625,
"learning_rate": 8.4801e-06,
"loss": -0.0042,
"num_tokens": 1487427860.0,
"reward": 1.0873632788658143,
"reward_std": 0.0765454389154911,
"rewards/reward_accuracy/mean": 0.9875,
"rewards/reward_accuracy/std": 0.0751818560063839,
"rewards/reward_format/mean": 0.09986328110098838,
"rewards/reward_format/std": 0.0021875001257285476,
"sampling/importance_sampling_ratio/max": 2.406317377090454,
"sampling/importance_sampling_ratio/mean": 0.99002525806427,
"sampling/importance_sampling_ratio/min": 0.1970585733652115,
"sampling/sampling_logp_difference/max": 1.033064639568329,
"sampling/sampling_logp_difference/mean": 0.0035815596347674727,
"step": 15200,
"step_time": 5.62609824288811
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 636.2,
"completions/max_terminated_length": 539.6,
"completions/mean_length": 144.786328125,
"completions/mean_terminated_length": 142.55914611816405,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.032963823154568674,
"epoch": 32.569593147751604,
"frac_reward_zero_std": 0.96875,
"grad_norm": 0.0,
"learning_rate": 8.479100000000002e-06,
"loss": 0.0016,
"num_tokens": 1488313137.0,
"reward": 1.0877734541893005,
"reward_std": 0.07392919957637786,
"rewards/reward_accuracy/mean": 0.987890625,
"rewards/reward_accuracy/std": 0.07320919334888458,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.0010782781988382339,
"sampling/importance_sampling_ratio/max": 2.463735783100128,
"sampling/importance_sampling_ratio/mean": 0.9958021998405456,
"sampling/importance_sampling_ratio/min": 0.11144071072340012,
"sampling/sampling_logp_difference/max": 1.0770709037780761,
"sampling/sampling_logp_difference/mean": 0.003634589002467692,
"step": 15210,
"step_time": 3.5195595006196525
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1299.7,
"completions/max_terminated_length": 1013.4,
"completions/mean_length": 157.7421875,
"completions/mean_terminated_length": 149.67906036376954,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.041077648545615374,
"epoch": 32.59100642398287,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.361328125,
"learning_rate": 8.478100000000001e-06,
"loss": -0.0079,
"num_tokens": 1489230701.0,
"reward": 1.0676953494548798,
"reward_std": 0.12724095806479455,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.12632433995604514,
"rewards/reward_format/mean": 0.09972656518220901,
"rewards/reward_format/std": 0.0026420939713716505,
"sampling/importance_sampling_ratio/max": 2.357902455329895,
"sampling/importance_sampling_ratio/mean": 0.9798960864543915,
"sampling/importance_sampling_ratio/min": 0.05444173337891698,
"sampling/sampling_logp_difference/max": 0.9368861973285675,
"sampling/sampling_logp_difference/mean": 0.0038275240221992135,
"step": 15220,
"step_time": 6.317245243297657
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 754.9,
"completions/max_terminated_length": 668.3,
"completions/mean_length": 141.874609375,
"completions/mean_terminated_length": 138.91327209472655,
"completions/min_length": 67.5,
"completions/min_terminated_length": 67.5,
"entropy": 0.03451827752869576,
"epoch": 32.61241970021413,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.59765625,
"learning_rate": 8.4771e-06,
"loss": 0.0,
"num_tokens": 1490108460.0,
"reward": 1.0768554925918579,
"reward_std": 0.11546299010515212,
"rewards/reward_accuracy/mean": 0.976953125,
"rewards/reward_accuracy/std": 0.11507504656910897,
"rewards/reward_format/mean": 0.09990234524011612,
"rewards/reward_format/std": 0.0013226743787527085,
"sampling/importance_sampling_ratio/max": 2.356416177749634,
"sampling/importance_sampling_ratio/mean": 0.9935881733894348,
"sampling/importance_sampling_ratio/min": 0.1995488665997982,
"sampling/sampling_logp_difference/max": 0.9557997465133667,
"sampling/sampling_logp_difference/mean": 0.0037625545170158147,
"step": 15230,
"step_time": 3.88364778640389
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1099.3,
"completions/max_terminated_length": 813.9,
"completions/mean_length": 136.149609375,
"completions/mean_terminated_length": 134.6524345397949,
"completions/min_length": 60.6,
"completions/min_terminated_length": 60.6,
"entropy": 0.034821746335364875,
"epoch": 32.6338329764454,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.380859375,
"learning_rate": 8.4761e-06,
"loss": -0.008,
"num_tokens": 1490972587.0,
"reward": 1.0830859422683716,
"reward_std": 0.09212900176644326,
"rewards/reward_accuracy/mean": 0.983203125,
"rewards/reward_accuracy/std": 0.09079669788479805,
"rewards/reward_format/mean": 0.09988281279802322,
"rewards/reward_format/std": 0.0018750001210719347,
"sampling/importance_sampling_ratio/max": 2.5342894077301024,
"sampling/importance_sampling_ratio/mean": 0.9917110562324524,
"sampling/importance_sampling_ratio/min": 0.1339932220056653,
"sampling/sampling_logp_difference/max": 0.9502469062805176,
"sampling/sampling_logp_difference/mean": 0.0038586076581850646,
"step": 15240,
"step_time": 5.3123108587024035
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1327.7,
"completions/max_terminated_length": 1058.7,
"completions/mean_length": 155.319921875,
"completions/mean_terminated_length": 148.63643951416014,
"completions/min_length": 63.7,
"completions/min_terminated_length": 63.7,
"entropy": 0.04060824904590845,
"epoch": 32.65524625267666,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.546875,
"learning_rate": 8.475100000000001e-06,
"loss": -0.0046,
"num_tokens": 1491883486.0,
"reward": 1.0637890577316285,
"reward_std": 0.1615943618118763,
"rewards/reward_accuracy/mean": 0.9640625,
"rewards/reward_accuracy/std": 0.16005595847964288,
"rewards/reward_format/mean": 0.09972656220197677,
"rewards/reward_format/std": 0.0031241744989529254,
"sampling/importance_sampling_ratio/max": 2.2770654916763307,
"sampling/importance_sampling_ratio/mean": 0.9747242033481598,
"sampling/importance_sampling_ratio/min": 0.12124099731445312,
"sampling/sampling_logp_difference/max": 0.9653690099716187,
"sampling/sampling_logp_difference/mean": 0.003839743253774941,
"step": 15250,
"step_time": 6.54621580739622
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 778.7,
"completions/max_terminated_length": 778.7,
"completions/mean_length": 132.810546875,
"completions/mean_terminated_length": 132.810546875,
"completions/min_length": 61.5,
"completions/min_terminated_length": 61.5,
"entropy": 0.03259591686073691,
"epoch": 32.676659528907926,
"frac_reward_zero_std": 0.96875,
"grad_norm": 0.0,
"learning_rate": 8.4741e-06,
"loss": -0.0039,
"num_tokens": 1492737625.0,
"reward": 1.0851367354393004,
"reward_std": 0.07343996092677116,
"rewards/reward_accuracy/mean": 0.98515625,
"rewards/reward_accuracy/std": 0.07343338057398796,
"rewards/reward_format/mean": 0.09998046979308128,
"rewards/reward_format/std": 0.0003125000046566129,
"sampling/importance_sampling_ratio/max": 2.3062446475028993,
"sampling/importance_sampling_ratio/mean": 0.979681271314621,
"sampling/importance_sampling_ratio/min": 0.12919761538505553,
"sampling/sampling_logp_difference/max": 0.8721301555633545,
"sampling/sampling_logp_difference/mean": 0.0036998790223151446,
"step": 15260,
"step_time": 3.943156314402586
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1363.8,
"completions/max_terminated_length": 1308.2,
"completions/mean_length": 175.837890625,
"completions/mean_terminated_length": 159.9460205078125,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.053011538833379744,
"epoch": 32.698072805139184,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.0,
"learning_rate": 8.4731e-06,
"loss": -0.0062,
"num_tokens": 1493713098.0,
"reward": 1.0482422173023225,
"reward_std": 0.17019303441047667,
"rewards/reward_accuracy/mean": 0.948828125,
"rewards/reward_accuracy/std": 0.16823847591876984,
"rewards/reward_format/mean": 0.09941406473517418,
"rewards/reward_format/std": 0.003787638247013092,
"sampling/importance_sampling_ratio/max": 2.6746101140975953,
"sampling/importance_sampling_ratio/mean": 0.9842543780803681,
"sampling/importance_sampling_ratio/min": 0.13954381830990314,
"sampling/sampling_logp_difference/max": 0.959105259180069,
"sampling/sampling_logp_difference/mean": 0.0045043233083561065,
"step": 15270,
"step_time": 6.923523162808851
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1088.6,
"completions/max_terminated_length": 928.3,
"completions/mean_length": 140.564453125,
"completions/mean_terminated_length": 139.07015686035157,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.03507603243924677,
"epoch": 32.71948608137045,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.59375,
"learning_rate": 8.472100000000001e-06,
"loss": -0.0112,
"num_tokens": 1494588671.0,
"reward": 1.0874804854393005,
"reward_std": 0.08541354387998581,
"rewards/reward_accuracy/mean": 0.9875,
"rewards/reward_accuracy/std": 0.0853301927447319,
"rewards/reward_format/mean": 0.09998046979308128,
"rewards/reward_format/std": 0.0003125000046566129,
"sampling/importance_sampling_ratio/max": 2.4763420939445497,
"sampling/importance_sampling_ratio/mean": 0.9947469890117645,
"sampling/importance_sampling_ratio/min": 0.14784036949276924,
"sampling/sampling_logp_difference/max": 0.8048135876655579,
"sampling/sampling_logp_difference/mean": 0.003770662285387516,
"step": 15280,
"step_time": 5.293759077612776
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1091.4,
"completions/max_terminated_length": 719.6,
"completions/mean_length": 145.5640625,
"completions/mean_terminated_length": 143.33860397338867,
"completions/min_length": 62.2,
"completions/min_terminated_length": 62.2,
"entropy": 0.03408600322436541,
"epoch": 32.74089935760171,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0,
"learning_rate": 8.471100000000001e-06,
"loss": -0.0031,
"num_tokens": 1495482035.0,
"reward": 1.081933617591858,
"reward_std": 0.08968869522213936,
"rewards/reward_accuracy/mean": 0.98203125,
"rewards/reward_accuracy/std": 0.08858726471662522,
"rewards/reward_format/mean": 0.09990234524011612,
"rewards/reward_format/std": 0.0013226743787527085,
"sampling/importance_sampling_ratio/max": 2.554253840446472,
"sampling/importance_sampling_ratio/mean": 0.9947838306427002,
"sampling/importance_sampling_ratio/min": 0.16021974049508572,
"sampling/sampling_logp_difference/max": 0.996519672870636,
"sampling/sampling_logp_difference/mean": 0.003802786162123084,
"step": 15290,
"step_time": 5.254836613489897
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1226.0,
"completions/max_terminated_length": 1082.6,
"completions/mean_length": 157.769921875,
"completions/mean_terminated_length": 148.22848358154297,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.04283686513081193,
"epoch": 32.76231263383298,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.5,
"learning_rate": 8.4701e-06,
"loss": -0.0044,
"num_tokens": 1496403926.0,
"reward": 1.0563281536102296,
"reward_std": 0.14626203179359437,
"rewards/reward_accuracy/mean": 0.956640625,
"rewards/reward_accuracy/std": 0.1450535424053669,
"rewards/reward_format/mean": 0.09968750104308129,
"rewards/reward_format/std": 0.0035004840465262532,
"sampling/importance_sampling_ratio/max": 2.4937074780464172,
"sampling/importance_sampling_ratio/mean": 0.988933652639389,
"sampling/importance_sampling_ratio/min": 0.18410306442528962,
"sampling/sampling_logp_difference/max": 1.0016834139823914,
"sampling/sampling_logp_difference/mean": 0.0041673650266602635,
"step": 15300,
"step_time": 6.193294532393338
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1180.0,
"completions/max_terminated_length": 1003.7,
"completions/mean_length": 162.060546875,
"completions/mean_terminated_length": 157.6506591796875,
"completions/min_length": 69.8,
"completions/min_terminated_length": 69.8,
"entropy": 0.03903811348136514,
"epoch": 32.78372591006424,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.52734375,
"learning_rate": 8.469100000000002e-06,
"loss": -0.0003,
"num_tokens": 1497339217.0,
"reward": 1.0498633146286012,
"reward_std": 0.18346271365880967,
"rewards/reward_accuracy/mean": 0.95,
"rewards/reward_accuracy/std": 0.18288106918334962,
"rewards/reward_format/mean": 0.09986328333616257,
"rewards/reward_format/std": 0.0015798230189830065,
"sampling/importance_sampling_ratio/max": 2.5308359146118162,
"sampling/importance_sampling_ratio/mean": 0.9952291965484619,
"sampling/importance_sampling_ratio/min": 0.12923604440875353,
"sampling/sampling_logp_difference/max": 1.021000826358795,
"sampling/sampling_logp_difference/mean": 0.0037008550483733416,
"step": 15310,
"step_time": 5.696496862202184
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1234.8,
"completions/max_terminated_length": 983.2,
"completions/mean_length": 159.606640625,
"completions/mean_terminated_length": 151.5628204345703,
"completions/min_length": 62.6,
"completions/min_terminated_length": 62.6,
"entropy": 0.03869003129657358,
"epoch": 32.805139186295506,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.06591796875,
"learning_rate": 8.4681e-06,
"loss": -0.0033,
"num_tokens": 1498274450.0,
"reward": 1.0603711128234863,
"reward_std": 0.15709154978394507,
"rewards/reward_accuracy/mean": 0.960546875,
"rewards/reward_accuracy/std": 0.1560543656349182,
"rewards/reward_format/mean": 0.0998242199420929,
"rewards/reward_format/std": 0.001815961324609816,
"sampling/importance_sampling_ratio/max": 2.4651854157447817,
"sampling/importance_sampling_ratio/mean": 0.9826239168643951,
"sampling/importance_sampling_ratio/min": 0.10483592748641968,
"sampling/sampling_logp_difference/max": 1.192632758617401,
"sampling/sampling_logp_difference/mean": 0.003909539245069027,
"step": 15320,
"step_time": 6.353258966008434
},
{
"clip_ratio/high_max": 4.011553392047062e-06,
"clip_ratio/high_mean": 5.014441740058828e-07,
"clip_ratio/low_mean": 1.7058678395187598e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.2073119680499074e-06,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1359.0,
"completions/max_terminated_length": 1031.5,
"completions/mean_length": 155.399609375,
"completions/mean_terminated_length": 144.34418334960938,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.03712874052580446,
"epoch": 32.82655246252676,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.4671e-06,
"loss": -0.0051,
"num_tokens": 1499190193.0,
"reward": 1.0827734470367432,
"reward_std": 0.10325325950980187,
"rewards/reward_accuracy/mean": 0.983203125,
"rewards/reward_accuracy/std": 0.10141479671001434,
"rewards/reward_format/mean": 0.09957031309604644,
"rewards/reward_format/std": 0.0025662323925644158,
"sampling/importance_sampling_ratio/max": 2.586918807029724,
"sampling/importance_sampling_ratio/mean": 0.9825304269790649,
"sampling/importance_sampling_ratio/min": 0.174930340051651,
"sampling/sampling_logp_difference/max": 1.2188499689102172,
"sampling/sampling_logp_difference/mean": 0.003769462322816253,
"step": 15330,
"step_time": 6.619790949110756
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1138.6,
"completions/max_terminated_length": 804.5,
"completions/mean_length": 141.284375,
"completions/mean_terminated_length": 138.30420532226563,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.0327490147203207,
"epoch": 32.84796573875803,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.1416015625,
"learning_rate": 8.4661e-06,
"loss": -0.003,
"num_tokens": 1500073721.0,
"reward": 1.0792187690734862,
"reward_std": 0.0973492681980133,
"rewards/reward_accuracy/mean": 0.979296875,
"rewards/reward_accuracy/std": 0.09657016545534133,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.0012500001117587089,
"sampling/importance_sampling_ratio/max": 2.286910128593445,
"sampling/importance_sampling_ratio/mean": 0.9821549117565155,
"sampling/importance_sampling_ratio/min": 0.17387867197394372,
"sampling/sampling_logp_difference/max": 0.872059839963913,
"sampling/sampling_logp_difference/mean": 0.003572203731164336,
"step": 15340,
"step_time": 5.4941588776797285
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1477.9,
"completions/max_terminated_length": 953.8,
"completions/mean_length": 160.398828125,
"completions/mean_terminated_length": 152.3484085083008,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.03777425684966147,
"epoch": 32.86937901498929,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 8.465100000000001e-06,
"loss": -0.0095,
"num_tokens": 1501001526.0,
"reward": 1.0774609565734863,
"reward_std": 0.11581789776682853,
"rewards/reward_accuracy/mean": 0.977734375,
"rewards/reward_accuracy/std": 0.11380420550704003,
"rewards/reward_format/mean": 0.0997265636920929,
"rewards/reward_format/std": 0.003464208706282079,
"sampling/importance_sampling_ratio/max": 2.448553431034088,
"sampling/importance_sampling_ratio/mean": 0.9847819685935975,
"sampling/importance_sampling_ratio/min": 0.12053140327334404,
"sampling/sampling_logp_difference/max": 1.0113587260246277,
"sampling/sampling_logp_difference/mean": 0.0037418146152049304,
"step": 15350,
"step_time": 7.289866737907869
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1001.5,
"completions/max_terminated_length": 794.7,
"completions/mean_length": 151.800390625,
"completions/mean_terminated_length": 147.3454490661621,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.035703504970297215,
"epoch": 32.890792291220556,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.4641e-06,
"loss": -0.0085,
"num_tokens": 1501908711.0,
"reward": 1.0720508098602295,
"reward_std": 0.14821677953004836,
"rewards/reward_accuracy/mean": 0.972265625,
"rewards/reward_accuracy/std": 0.1467520147562027,
"rewards/reward_format/mean": 0.09978515803813934,
"rewards/reward_format/std": 0.001911549549549818,
"sampling/importance_sampling_ratio/max": 2.5508246302604674,
"sampling/importance_sampling_ratio/mean": 0.9960651338100434,
"sampling/importance_sampling_ratio/min": 0.08525996208190918,
"sampling/sampling_logp_difference/max": 1.050898253917694,
"sampling/sampling_logp_difference/mean": 0.0038138892967253925,
"step": 15360,
"step_time": 4.925770690091303
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1333.8,
"completions/max_terminated_length": 1170.8,
"completions/mean_length": 158.628515625,
"completions/mean_terminated_length": 148.36717224121094,
"completions/min_length": 60.3,
"completions/min_terminated_length": 60.3,
"entropy": 0.04410853278823197,
"epoch": 32.91220556745182,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.4631e-06,
"loss": -0.0056,
"num_tokens": 1502825904.0,
"reward": 1.0737890899181366,
"reward_std": 0.11658615320920944,
"rewards/reward_accuracy/mean": 0.97421875,
"rewards/reward_accuracy/std": 0.11387001052498817,
"rewards/reward_format/mean": 0.09957031458616257,
"rewards/reward_format/std": 0.004379358980804682,
"sampling/importance_sampling_ratio/max": 2.357502806186676,
"sampling/importance_sampling_ratio/mean": 0.9884828329086304,
"sampling/importance_sampling_ratio/min": 0.11629019007086754,
"sampling/sampling_logp_difference/max": 1.1225679516792297,
"sampling/sampling_logp_difference/mean": 0.003993779071606696,
"step": 15370,
"step_time": 6.590466214396292
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 985.9,
"completions/max_terminated_length": 811.5,
"completions/mean_length": 156.427734375,
"completions/mean_terminated_length": 144.7499740600586,
"completions/min_length": 67.9,
"completions/min_terminated_length": 67.9,
"entropy": 0.0414296614471823,
"epoch": 32.933618843683085,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.462100000000002e-06,
"loss": -0.0069,
"num_tokens": 1503739143.0,
"reward": 1.066464865207672,
"reward_std": 0.14320606887340545,
"rewards/reward_accuracy/mean": 0.966796875,
"rewards/reward_accuracy/std": 0.1418164476752281,
"rewards/reward_format/mean": 0.09966797009110451,
"rewards/reward_format/std": 0.0026208248222246767,
"sampling/importance_sampling_ratio/max": 2.350379204750061,
"sampling/importance_sampling_ratio/mean": 0.98081334233284,
"sampling/importance_sampling_ratio/min": 0.20742679685354232,
"sampling/sampling_logp_difference/max": 0.8635475516319275,
"sampling/sampling_logp_difference/mean": 0.0037477646954357626,
"step": 15380,
"step_time": 5.279726973205106
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1222.3,
"completions/max_terminated_length": 1028.1,
"completions/mean_length": 158.890625,
"completions/mean_terminated_length": 153.16859436035156,
"completions/min_length": 65.8,
"completions/min_terminated_length": 65.8,
"entropy": 0.03934099182952196,
"epoch": 32.95503211991435,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.461100000000001e-06,
"loss": 0.0019,
"num_tokens": 1504663695.0,
"reward": 1.0575586080551147,
"reward_std": 0.172669817507267,
"rewards/reward_accuracy/mean": 0.9578125,
"rewards/reward_accuracy/std": 0.1716109223663807,
"rewards/reward_format/mean": 0.09974609464406967,
"rewards/reward_format/std": 0.0028051254572346806,
"sampling/importance_sampling_ratio/max": 2.532987987995148,
"sampling/importance_sampling_ratio/mean": 0.9922164738178253,
"sampling/importance_sampling_ratio/min": 0.18476251270622016,
"sampling/sampling_logp_difference/max": 1.0059077739715576,
"sampling/sampling_logp_difference/mean": 0.003955075005069375,
"step": 15390,
"step_time": 6.018796309400932
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1191.5,
"completions/max_terminated_length": 811.7,
"completions/mean_length": 152.18046875,
"completions/mean_terminated_length": 147.03567504882812,
"completions/min_length": 62.0,
"completions/min_terminated_length": 62.0,
"entropy": 0.038199835503473875,
"epoch": 32.97644539614561,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.166015625,
"learning_rate": 8.4601e-06,
"loss": -0.0069,
"num_tokens": 1505570541.0,
"reward": 1.0532812654972077,
"reward_std": 0.16642068773508073,
"rewards/reward_accuracy/mean": 0.953515625,
"rewards/reward_accuracy/std": 0.1655287489295006,
"rewards/reward_format/mean": 0.09976562559604644,
"rewards/reward_format/std": 0.002568871108815074,
"sampling/importance_sampling_ratio/max": 2.7172763109207154,
"sampling/importance_sampling_ratio/mean": 0.9862430214881897,
"sampling/importance_sampling_ratio/min": 0.12236514836549758,
"sampling/sampling_logp_difference/max": 1.011013925075531,
"sampling/sampling_logp_difference/mean": 0.0038334243232384323,
"step": 15400,
"step_time": 5.943480066896882
},
{
"clip_ratio/high_max": 5.973239967715926e-06,
"clip_ratio/high_mean": 7.466549959644908e-07,
"clip_ratio/low_mean": 1.0157544238609262e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.762409374350682e-06,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1277.1,
"completions/max_terminated_length": 1166.4,
"completions/mean_length": 172.73359375,
"completions/mean_terminated_length": 156.57687225341797,
"completions/min_length": 70.7,
"completions/min_terminated_length": 70.7,
"entropy": 0.04725630437023938,
"epoch": 32.99785867237687,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.115234375,
"learning_rate": 8.459100000000002e-06,
"loss": 0.0008,
"num_tokens": 1506539027.0,
"reward": 1.0691211104393006,
"reward_std": 0.15075090378522873,
"rewards/reward_accuracy/mean": 0.96953125,
"rewards/reward_accuracy/std": 0.14912587776780128,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.0030048549408093093,
"sampling/importance_sampling_ratio/max": 2.6201306581497192,
"sampling/importance_sampling_ratio/mean": 0.9885594844818115,
"sampling/importance_sampling_ratio/min": 0.09740961268544197,
"sampling/sampling_logp_difference/max": 1.0876730680465698,
"sampling/sampling_logp_difference/mean": 0.004269835771992803,
"step": 15410,
"step_time": 6.626000433287118
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1202.9,
"completions/max_terminated_length": 701.8,
"completions/mean_length": 137.68828125,
"completions/mean_terminated_length": 135.43324127197266,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.03283301112242043,
"epoch": 33.019271948608136,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.07568359375,
"learning_rate": 8.4581e-06,
"loss": -0.0028,
"num_tokens": 1507403813.0,
"reward": 1.0850781321525573,
"reward_std": 0.0761457245098427,
"rewards/reward_accuracy/mean": 0.98515625,
"rewards/reward_accuracy/std": 0.07489572763442993,
"rewards/reward_format/mean": 0.09992187544703483,
"rewards/reward_format/std": 0.0012500000651925803,
"sampling/importance_sampling_ratio/max": 2.4168882966041565,
"sampling/importance_sampling_ratio/mean": 0.985172712802887,
"sampling/importance_sampling_ratio/min": 0.16095557138323785,
"sampling/sampling_logp_difference/max": 0.8999104857444763,
"sampling/sampling_logp_difference/mean": 0.003522937488742173,
"step": 15420,
"step_time": 5.966917234714492
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1432.1,
"completions/max_terminated_length": 1289.4,
"completions/mean_length": 153.926171875,
"completions/mean_terminated_length": 145.19007720947266,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.042367413127794865,
"epoch": 33.0406852248394,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.294921875,
"learning_rate": 8.4571e-06,
"loss": -0.0069,
"num_tokens": 1508314696.0,
"reward": 1.0535351634025574,
"reward_std": 0.1674004778265953,
"rewards/reward_accuracy/mean": 0.95390625,
"rewards/reward_accuracy/std": 0.1663012385368347,
"rewards/reward_format/mean": 0.09962890669703484,
"rewards/reward_format/std": 0.0030595290940254928,
"sampling/importance_sampling_ratio/max": 2.4917768955230715,
"sampling/importance_sampling_ratio/mean": 0.9788728475570678,
"sampling/importance_sampling_ratio/min": 0.12854536958038806,
"sampling/sampling_logp_difference/max": 1.2337559700012206,
"sampling/sampling_logp_difference/mean": 0.004102177126333118,
"step": 15430,
"step_time": 6.798654434306082
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1443.1,
"completions/max_terminated_length": 1241.9,
"completions/mean_length": 165.970703125,
"completions/mean_terminated_length": 153.5862777709961,
"completions/min_length": 70.7,
"completions/min_terminated_length": 70.7,
"entropy": 0.04067769204266369,
"epoch": 33.062098501070665,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.4561e-06,
"loss": -0.0053,
"num_tokens": 1509256781.0,
"reward": 1.0757617473602294,
"reward_std": 0.10113889947533608,
"rewards/reward_accuracy/mean": 0.976171875,
"rewards/reward_accuracy/std": 0.09913232997059822,
"rewards/reward_format/mean": 0.09958984404802322,
"rewards/reward_format/std": 0.0035364021314308047,
"sampling/importance_sampling_ratio/max": 2.2405527949333193,
"sampling/importance_sampling_ratio/mean": 0.9920042634010315,
"sampling/importance_sampling_ratio/min": 0.1834438018500805,
"sampling/sampling_logp_difference/max": 1.3305721998214721,
"sampling/sampling_logp_difference/mean": 0.003808874823153019,
"step": 15440,
"step_time": 7.259030940692173
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 929.6,
"completions/max_terminated_length": 749.2,
"completions/mean_length": 138.12265625,
"completions/mean_terminated_length": 137.37444915771485,
"completions/min_length": 61.9,
"completions/min_terminated_length": 61.9,
"entropy": 0.031762042199261487,
"epoch": 33.08351177730193,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.2373046875,
"learning_rate": 8.4551e-06,
"loss": -0.002,
"num_tokens": 1510122599.0,
"reward": 1.072246116399765,
"reward_std": 0.10210933685302734,
"rewards/reward_accuracy/mean": 0.972265625,
"rewards/reward_accuracy/std": 0.10205613151192665,
"rewards/reward_format/mean": 0.09998046979308128,
"rewards/reward_format/std": 0.0003125000046566129,
"sampling/importance_sampling_ratio/max": 2.3094767451286318,
"sampling/importance_sampling_ratio/mean": 0.9846013963222504,
"sampling/importance_sampling_ratio/min": 0.09310098588466645,
"sampling/sampling_logp_difference/max": 1.0752622365951539,
"sampling/sampling_logp_difference/mean": 0.0035512261791154744,
"step": 15450,
"step_time": 4.576242021977668
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1112.7,
"completions/max_terminated_length": 1056.8,
"completions/mean_length": 156.60625,
"completions/mean_terminated_length": 152.98633728027343,
"completions/min_length": 62.9,
"completions/min_terminated_length": 62.9,
"entropy": 0.041863493528217076,
"epoch": 33.104925053533194,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.2236328125,
"learning_rate": 8.454100000000001e-06,
"loss": -0.0034,
"num_tokens": 1511039159.0,
"reward": 1.0724218845367433,
"reward_std": 0.13037858670577407,
"rewards/reward_accuracy/mean": 0.97265625,
"rewards/reward_accuracy/std": 0.12935589030385017,
"rewards/reward_format/mean": 0.09976562559604644,
"rewards/reward_format/std": 0.002170510101132095,
"sampling/importance_sampling_ratio/max": 2.5836962699890136,
"sampling/importance_sampling_ratio/mean": 0.986788946390152,
"sampling/importance_sampling_ratio/min": 0.10243121907114983,
"sampling/sampling_logp_difference/max": 1.0103331089019776,
"sampling/sampling_logp_difference/mean": 0.0038547023432329297,
"step": 15460,
"step_time": 5.813620976486709
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1335.5,
"completions/max_terminated_length": 1023.6,
"completions/mean_length": 163.10703125,
"completions/mean_terminated_length": 148.28276977539062,
"completions/min_length": 63.7,
"completions/min_terminated_length": 63.7,
"entropy": 0.04155663033016026,
"epoch": 33.12633832976445,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.12158203125,
"learning_rate": 8.4531e-06,
"loss": -0.0015,
"num_tokens": 1511976953.0,
"reward": 1.0772656321525573,
"reward_std": 0.12148883417248726,
"rewards/reward_accuracy/mean": 0.977734375,
"rewards/reward_accuracy/std": 0.11925085261464119,
"rewards/reward_format/mean": 0.09953125044703484,
"rewards/reward_format/std": 0.003875483525916934,
"sampling/importance_sampling_ratio/max": 2.480108177661896,
"sampling/importance_sampling_ratio/mean": 0.9942494571208954,
"sampling/importance_sampling_ratio/min": 0.17945871204137803,
"sampling/sampling_logp_difference/max": 1.0540142357349396,
"sampling/sampling_logp_difference/mean": 0.004105081176385283,
"step": 15470,
"step_time": 6.729217915603658
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1147.5,
"completions/max_terminated_length": 986.0,
"completions/mean_length": 154.832421875,
"completions/mean_terminated_length": 150.41895599365233,
"completions/min_length": 68.3,
"completions/min_terminated_length": 68.3,
"entropy": 0.03583867207635194,
"epoch": 33.147751605995715,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.2890625,
"learning_rate": 8.452100000000002e-06,
"loss": 0.0037,
"num_tokens": 1512894476.0,
"reward": 1.0677343964576722,
"reward_std": 0.1428995333611965,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.1411496214568615,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0025854269973933698,
"sampling/importance_sampling_ratio/max": 2.4821298122406006,
"sampling/importance_sampling_ratio/mean": 0.9869244456291199,
"sampling/importance_sampling_ratio/min": 0.12845927327871323,
"sampling/sampling_logp_difference/max": 0.9707173228263855,
"sampling/sampling_logp_difference/mean": 0.00389259522780776,
"step": 15480,
"step_time": 5.622376510221511
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1235.6,
"completions/max_terminated_length": 742.3,
"completions/mean_length": 143.83359375,
"completions/mean_terminated_length": 140.1116912841797,
"completions/min_length": 68.3,
"completions/min_terminated_length": 68.3,
"entropy": 0.03305806396529078,
"epoch": 33.16916488222698,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.0859375,
"learning_rate": 8.451100000000001e-06,
"loss": -0.0056,
"num_tokens": 1513785186.0,
"reward": 1.0955273509025574,
"reward_std": 0.04801808595657349,
"rewards/reward_accuracy/mean": 0.995703125,
"rewards/reward_accuracy/std": 0.04606872871518135,
"rewards/reward_format/mean": 0.09982421919703484,
"rewards/reward_format/std": 0.0028125002281740308,
"sampling/importance_sampling_ratio/max": 2.296148920059204,
"sampling/importance_sampling_ratio/mean": 0.9862317740917206,
"sampling/importance_sampling_ratio/min": 0.12679516524076462,
"sampling/sampling_logp_difference/max": 0.9447376310825348,
"sampling/sampling_logp_difference/mean": 0.003795612626709044,
"step": 15490,
"step_time": 5.918418743411894
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1238.3,
"completions/max_terminated_length": 900.6,
"completions/mean_length": 149.509375,
"completions/mean_terminated_length": 146.5581527709961,
"completions/min_length": 60.0,
"completions/min_terminated_length": 60.0,
"entropy": 0.03496562498621643,
"epoch": 33.190578158458244,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.4501e-06,
"loss": -0.0021,
"num_tokens": 1514684858.0,
"reward": 1.074121117591858,
"reward_std": 0.11420853734016419,
"rewards/reward_accuracy/mean": 0.97421875,
"rewards/reward_accuracy/std": 0.11348417848348617,
"rewards/reward_format/mean": 0.09990234524011612,
"rewards/reward_format/std": 0.0013226743787527085,
"sampling/importance_sampling_ratio/max": 2.5135201811790466,
"sampling/importance_sampling_ratio/mean": 0.9874793648719787,
"sampling/importance_sampling_ratio/min": 0.10486233979463577,
"sampling/sampling_logp_difference/max": 0.9716208219528198,
"sampling/sampling_logp_difference/mean": 0.0037395438412204385,
"step": 15500,
"step_time": 5.937629948093672
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1132.4,
"completions/max_terminated_length": 856.8,
"completions/mean_length": 152.595703125,
"completions/mean_terminated_length": 147.42542114257813,
"completions/min_length": 66.4,
"completions/min_terminated_length": 66.4,
"entropy": 0.036390691390261055,
"epoch": 33.21199143468951,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.1884765625,
"learning_rate": 8.449100000000002e-06,
"loss": -0.0049,
"num_tokens": 1515598175.0,
"reward": 1.0874414205551148,
"reward_std": 0.09136118963360787,
"rewards/reward_accuracy/mean": 0.9875,
"rewards/reward_accuracy/std": 0.09087077081203461,
"rewards/reward_format/mean": 0.09994140714406967,
"rewards/reward_format/std": 0.0009375000605359674,
"sampling/importance_sampling_ratio/max": 2.43772234916687,
"sampling/importance_sampling_ratio/mean": 0.9991339147090912,
"sampling/importance_sampling_ratio/min": 0.1517783708870411,
"sampling/sampling_logp_difference/max": 0.8734401345252991,
"sampling/sampling_logp_difference/mean": 0.003657688619568944,
"step": 15510,
"step_time": 5.560090370106627
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 946.4,
"completions/max_terminated_length": 870.3,
"completions/mean_length": 150.09296875,
"completions/mean_terminated_length": 143.50455780029296,
"completions/min_length": 67.5,
"completions/min_terminated_length": 67.5,
"entropy": 0.03537075570784509,
"epoch": 33.23340471092077,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0947265625,
"learning_rate": 8.4481e-06,
"loss": -0.0062,
"num_tokens": 1516504429.0,
"reward": 1.0531836152076721,
"reward_std": 0.14067650064826012,
"rewards/reward_accuracy/mean": 0.953515625,
"rewards/reward_accuracy/std": 0.13947870954871178,
"rewards/reward_format/mean": 0.09966797009110451,
"rewards/reward_format/std": 0.0027969195507466793,
"sampling/importance_sampling_ratio/max": 2.518282103538513,
"sampling/importance_sampling_ratio/mean": 0.9899865865707398,
"sampling/importance_sampling_ratio/min": 0.17714760042726993,
"sampling/sampling_logp_difference/max": 1.1557979702949523,
"sampling/sampling_logp_difference/mean": 0.0037714322097599506,
"step": 15520,
"step_time": 5.0261116669134935
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 835.5,
"completions/max_terminated_length": 793.4,
"completions/mean_length": 139.641015625,
"completions/mean_terminated_length": 138.8944351196289,
"completions/min_length": 66.5,
"completions/min_terminated_length": 66.5,
"entropy": 0.03338059156667441,
"epoch": 33.25481798715204,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.4471e-06,
"loss": -0.002,
"num_tokens": 1517380342.0,
"reward": 1.0902148604393005,
"reward_std": 0.06844365522265435,
"rewards/reward_accuracy/mean": 0.990234375,
"rewards/reward_accuracy/std": 0.06844125986099243,
"rewards/reward_format/mean": 0.09998046979308128,
"rewards/reward_format/std": 0.0003125000046566129,
"sampling/importance_sampling_ratio/max": 2.5732690572738646,
"sampling/importance_sampling_ratio/mean": 0.9982119202613831,
"sampling/importance_sampling_ratio/min": 0.15068037807941437,
"sampling/sampling_logp_difference/max": 1.024285113811493,
"sampling/sampling_logp_difference/mean": 0.0037812464870512486,
"step": 15530,
"step_time": 4.434363437094726
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1337.7,
"completions/max_terminated_length": 972.0,
"completions/mean_length": 156.194140625,
"completions/mean_terminated_length": 151.05356140136718,
"completions/min_length": 70.8,
"completions/min_terminated_length": 70.8,
"entropy": 0.03887236888986081,
"epoch": 33.276231263383295,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.1162109375,
"learning_rate": 8.4461e-06,
"loss": -0.0033,
"num_tokens": 1518304407.0,
"reward": 1.0798437476158143,
"reward_std": 0.10572100505232811,
"rewards/reward_accuracy/mean": 0.980078125,
"rewards/reward_accuracy/std": 0.10436694696545601,
"rewards/reward_format/mean": 0.09976562410593033,
"rewards/reward_format/std": 0.0030101181706413626,
"sampling/importance_sampling_ratio/max": 2.4676876187324526,
"sampling/importance_sampling_ratio/mean": 0.990932410955429,
"sampling/importance_sampling_ratio/min": 0.1723891519010067,
"sampling/sampling_logp_difference/max": 1.1893969416618346,
"sampling/sampling_logp_difference/mean": 0.003905677213333547,
"step": 15540,
"step_time": 6.44051847900555
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1488.2,
"completions/max_terminated_length": 1037.6,
"completions/mean_length": 157.328125,
"completions/mean_terminated_length": 146.9997589111328,
"completions/min_length": 69.9,
"completions/min_terminated_length": 69.9,
"entropy": 0.03838043997529894,
"epoch": 33.29764453961456,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.4451e-06,
"loss": -0.0023,
"num_tokens": 1519227919.0,
"reward": 1.0686914324760437,
"reward_std": 0.1454761005938053,
"rewards/reward_accuracy/mean": 0.969140625,
"rewards/reward_accuracy/std": 0.1433170072734356,
"rewards/reward_format/mean": 0.09955078288912773,
"rewards/reward_format/std": 0.004305425239726901,
"sampling/importance_sampling_ratio/max": 2.3787041544914245,
"sampling/importance_sampling_ratio/mean": 0.9961043655872345,
"sampling/importance_sampling_ratio/min": 0.12906542008277028,
"sampling/sampling_logp_difference/max": 0.9558722913265228,
"sampling/sampling_logp_difference/mean": 0.0037877651397138835,
"step": 15550,
"step_time": 7.195861307499581
},
{
"clip_ratio/high_max": 2.5940707564586775e-05,
"clip_ratio/high_mean": 3.242588445573347e-06,
"clip_ratio/low_mean": 1.501154542893346e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.74374292025459e-06,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1182.9,
"completions/max_terminated_length": 1098.3,
"completions/mean_length": 158.661328125,
"completions/mean_terminated_length": 146.2100357055664,
"completions/min_length": 61.6,
"completions/min_terminated_length": 61.6,
"entropy": 0.04128398154862225,
"epoch": 33.319057815845824,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.2392578125,
"learning_rate": 8.444100000000001e-06,
"loss": -0.0049,
"num_tokens": 1520153036.0,
"reward": 1.0569726824760437,
"reward_std": 0.15830625370144844,
"rewards/reward_accuracy/mean": 0.957421875,
"rewards/reward_accuracy/std": 0.15679396614432334,
"rewards/reward_format/mean": 0.09955078288912773,
"rewards/reward_format/std": 0.0028781146043911575,
"sampling/importance_sampling_ratio/max": 2.5091856718063354,
"sampling/importance_sampling_ratio/mean": 0.9839332699775696,
"sampling/importance_sampling_ratio/min": 0.0831770971417427,
"sampling/sampling_logp_difference/max": 1.0090594649314881,
"sampling/sampling_logp_difference/mean": 0.004206916433759034,
"step": 15560,
"step_time": 6.036506561117131
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1049.2,
"completions/max_terminated_length": 999.6,
"completions/mean_length": 136.812890625,
"completions/mean_terminated_length": 135.33389587402343,
"completions/min_length": 62.7,
"completions/min_terminated_length": 62.7,
"entropy": 0.03343245207797736,
"epoch": 33.34047109207709,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.0,
"learning_rate": 8.4431e-06,
"loss": -0.0028,
"num_tokens": 1521025101.0,
"reward": 1.0827344059944153,
"reward_std": 0.08065074309706688,
"rewards/reward_accuracy/mean": 0.9828125,
"rewards/reward_accuracy/std": 0.08007982149720191,
"rewards/reward_format/mean": 0.09992187693715096,
"rewards/reward_format/std": 0.0008821487426757812,
"sampling/importance_sampling_ratio/max": 2.2924190521240235,
"sampling/importance_sampling_ratio/mean": 0.9939866840839386,
"sampling/importance_sampling_ratio/min": 0.20021308660507203,
"sampling/sampling_logp_difference/max": 0.984948456287384,
"sampling/sampling_logp_difference/mean": 0.003572519798763096,
"step": 15570,
"step_time": 5.12861153249105
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1668.0,
"completions/max_terminated_length": 1277.7,
"completions/mean_length": 173.14609375,
"completions/mean_terminated_length": 161.451953125,
"completions/min_length": 68.6,
"completions/min_terminated_length": 68.6,
"entropy": 0.046212914679199454,
"epoch": 33.36188436830835,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.0615234375,
"learning_rate": 8.4421e-06,
"loss": -0.0089,
"num_tokens": 1521989251.0,
"reward": 1.0530859649181366,
"reward_std": 0.18576266393065452,
"rewards/reward_accuracy/mean": 0.953515625,
"rewards/reward_accuracy/std": 0.18383951112627983,
"rewards/reward_format/mean": 0.09957031458616257,
"rewards/reward_format/std": 0.003976369579322636,
"sampling/importance_sampling_ratio/max": 2.394400477409363,
"sampling/importance_sampling_ratio/mean": 0.9804731607437134,
"sampling/importance_sampling_ratio/min": 0.02967557907104492,
"sampling/sampling_logp_difference/max": 1.1275634586811065,
"sampling/sampling_logp_difference/mean": 0.0041723909555003045,
"step": 15580,
"step_time": 8.004337526398013
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1322.4,
"completions/max_terminated_length": 1139.5,
"completions/mean_length": 159.96640625,
"completions/mean_terminated_length": 148.97649841308595,
"completions/min_length": 65.2,
"completions/min_terminated_length": 65.2,
"entropy": 0.04330825740471482,
"epoch": 33.38329764453962,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 8.441100000000001e-06,
"loss": -0.0021,
"num_tokens": 1522922749.0,
"reward": 1.069394552707672,
"reward_std": 0.13400005623698236,
"rewards/reward_accuracy/mean": 0.969921875,
"rewards/reward_accuracy/std": 0.13165040761232377,
"rewards/reward_format/mean": 0.09947265684604645,
"rewards/reward_format/std": 0.004295098898001015,
"sampling/importance_sampling_ratio/max": 2.319702923297882,
"sampling/importance_sampling_ratio/mean": 0.987775844335556,
"sampling/importance_sampling_ratio/min": 0.11209532245993614,
"sampling/sampling_logp_difference/max": 1.1443936824798584,
"sampling/sampling_logp_difference/mean": 0.004016576730646193,
"step": 15590,
"step_time": 6.630948163379799
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 3.2005325465434e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.2005325465434e-07,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1353.1,
"completions/max_terminated_length": 917.2,
"completions/mean_length": 146.043359375,
"completions/mean_terminated_length": 135.59401779174806,
"completions/min_length": 60.4,
"completions/min_terminated_length": 60.4,
"entropy": 0.03790169672574848,
"epoch": 33.40471092077088,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.275390625,
"learning_rate": 8.4401e-06,
"loss": -0.0039,
"num_tokens": 1523811884.0,
"reward": 1.079199242591858,
"reward_std": 0.10992798954248428,
"rewards/reward_accuracy/mean": 0.9796875,
"rewards/reward_accuracy/std": 0.10797502249479293,
"rewards/reward_format/mean": 0.09951172024011612,
"rewards/reward_format/std": 0.002430351381190121,
"sampling/importance_sampling_ratio/max": 2.5102389812469483,
"sampling/importance_sampling_ratio/mean": 0.9816409051418304,
"sampling/importance_sampling_ratio/min": 0.07394137382507324,
"sampling/sampling_logp_difference/max": 0.9574601888656616,
"sampling/sampling_logp_difference/mean": 0.0038733824854716658,
"step": 15600,
"step_time": 6.594400068293908
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1369.6,
"completions/max_terminated_length": 1181.8,
"completions/mean_length": 165.0078125,
"completions/mean_terminated_length": 154.6966339111328,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.04202635632827878,
"epoch": 33.42612419700214,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.396484375,
"learning_rate": 8.439100000000002e-06,
"loss": -0.0065,
"num_tokens": 1524750144.0,
"reward": 1.0773047089576722,
"reward_std": 0.12952226027846336,
"rewards/reward_accuracy/mean": 0.977734375,
"rewards/reward_accuracy/std": 0.1274246409535408,
"rewards/reward_format/mean": 0.09957031384110451,
"rewards/reward_format/std": 0.003783126804046333,
"sampling/importance_sampling_ratio/max": 2.453339624404907,
"sampling/importance_sampling_ratio/mean": 0.9944136559963226,
"sampling/importance_sampling_ratio/min": 0.05161414071917534,
"sampling/sampling_logp_difference/max": 1.2440590739250184,
"sampling/sampling_logp_difference/mean": 0.003971485374495387,
"step": 15610,
"step_time": 6.742780422983924
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1277.0,
"completions/max_terminated_length": 741.9,
"completions/mean_length": 144.12265625,
"completions/mean_terminated_length": 136.71171340942382,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.04016820671968162,
"epoch": 33.4475374732334,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.076171875,
"learning_rate": 8.4381e-06,
"loss": -0.0042,
"num_tokens": 1525639418.0,
"reward": 1.077148449420929,
"reward_std": 0.11212341785430908,
"rewards/reward_accuracy/mean": 0.97734375,
"rewards/reward_accuracy/std": 0.11104121282696724,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.002496726461686194,
"sampling/importance_sampling_ratio/max": 2.5587223291397097,
"sampling/importance_sampling_ratio/mean": 0.9947729051113129,
"sampling/importance_sampling_ratio/min": 0.09116225875914097,
"sampling/sampling_logp_difference/max": 1.0362349450588226,
"sampling/sampling_logp_difference/mean": 0.0039414710132405165,
"step": 15620,
"step_time": 6.312194155296311
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1473.1,
"completions/max_terminated_length": 1241.3,
"completions/mean_length": 160.653515625,
"completions/mean_terminated_length": 157.02576751708983,
"completions/min_length": 65.1,
"completions/min_terminated_length": 65.1,
"entropy": 0.039473096211440864,
"epoch": 33.46895074946467,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.12255859375,
"learning_rate": 8.437100000000001e-06,
"loss": -0.0043,
"num_tokens": 1526570547.0,
"reward": 1.0642773628234863,
"reward_std": 0.14897226616740228,
"rewards/reward_accuracy/mean": 0.964453125,
"rewards/reward_accuracy/std": 0.14857167825102807,
"rewards/reward_format/mean": 0.0998242199420929,
"rewards/reward_format/std": 0.0018886924255639315,
"sampling/importance_sampling_ratio/max": 2.6337870597839355,
"sampling/importance_sampling_ratio/mean": 1.0004314541816712,
"sampling/importance_sampling_ratio/min": 0.12723351493477822,
"sampling/sampling_logp_difference/max": 1.0451322436332702,
"sampling/sampling_logp_difference/mean": 0.0038811465492472053,
"step": 15630,
"step_time": 7.091503059086972
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 715.8,
"completions/max_terminated_length": 535.4,
"completions/mean_length": 130.91171875,
"completions/mean_terminated_length": 128.6991744995117,
"completions/min_length": 68.4,
"completions/min_terminated_length": 68.4,
"entropy": 0.035831874469295144,
"epoch": 33.49036402569593,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.0,
"learning_rate": 8.4361e-06,
"loss": 0.0014,
"num_tokens": 1527412241.0,
"reward": 1.0596875190734862,
"reward_std": 0.1733373448252678,
"rewards/reward_accuracy/mean": 0.959765625,
"rewards/reward_accuracy/std": 0.17301912158727645,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.0012500001117587089,
"sampling/importance_sampling_ratio/max": 2.307244372367859,
"sampling/importance_sampling_ratio/mean": 0.9905577957630157,
"sampling/importance_sampling_ratio/min": 0.1997843489050865,
"sampling/sampling_logp_difference/max": 0.923326164484024,
"sampling/sampling_logp_difference/mean": 0.0039318704279139634,
"step": 15640,
"step_time": 3.913804127520416
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 773.4,
"completions/max_terminated_length": 772.6,
"completions/mean_length": 146.3703125,
"completions/mean_terminated_length": 144.1406280517578,
"completions/min_length": 61.9,
"completions/min_terminated_length": 61.9,
"entropy": 0.03315637407358736,
"epoch": 33.5117773019272,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.4351e-06,
"loss": -0.0027,
"num_tokens": 1528305733.0,
"reward": 1.0815234541893006,
"reward_std": 0.09514356330037117,
"rewards/reward_accuracy/mean": 0.981640625,
"rewards/reward_accuracy/std": 0.09442930147051812,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.0009831609204411507,
"sampling/importance_sampling_ratio/max": 2.3051183581352235,
"sampling/importance_sampling_ratio/mean": 0.9903060674667359,
"sampling/importance_sampling_ratio/min": 0.20344518572092057,
"sampling/sampling_logp_difference/max": 0.8901869714260101,
"sampling/sampling_logp_difference/mean": 0.0036056693643331528,
"step": 15650,
"step_time": 4.000262397501501
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1181.9,
"completions/max_terminated_length": 939.8,
"completions/mean_length": 151.057421875,
"completions/mean_terminated_length": 142.94207611083985,
"completions/min_length": 63.1,
"completions/min_terminated_length": 63.1,
"entropy": 0.040779984556138515,
"epoch": 33.53319057815846,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.349609375,
"learning_rate": 8.434100000000001e-06,
"loss": -0.0046,
"num_tokens": 1529206328.0,
"reward": 1.0756445527076721,
"reward_std": 0.10981882363557816,
"rewards/reward_accuracy/mean": 0.97578125,
"rewards/reward_accuracy/std": 0.10913942381739616,
"rewards/reward_format/mean": 0.09986328259110451,
"rewards/reward_format/std": 0.0016357229789718986,
"sampling/importance_sampling_ratio/max": 2.3180432081222535,
"sampling/importance_sampling_ratio/mean": 0.9852278828620911,
"sampling/importance_sampling_ratio/min": 0.06474983803927899,
"sampling/sampling_logp_difference/max": 0.8843354523181916,
"sampling/sampling_logp_difference/mean": 0.003843441465869546,
"step": 15660,
"step_time": 5.932393831410446
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1132.3,
"completions/max_terminated_length": 1071.7,
"completions/mean_length": 163.650390625,
"completions/mean_terminated_length": 152.7506576538086,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.042406791099347176,
"epoch": 33.55460385438972,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.2490234375,
"learning_rate": 8.4331e-06,
"loss": -0.0037,
"num_tokens": 1530142217.0,
"reward": 1.0683007955551147,
"reward_std": 0.13963167667388915,
"rewards/reward_accuracy/mean": 0.96875,
"rewards/reward_accuracy/std": 0.1376842088997364,
"rewards/reward_format/mean": 0.09955078214406968,
"rewards/reward_format/std": 0.0033215015195310117,
"sampling/importance_sampling_ratio/max": 2.3479689717292787,
"sampling/importance_sampling_ratio/mean": 0.9966677606105805,
"sampling/importance_sampling_ratio/min": 0.12793701514601707,
"sampling/sampling_logp_difference/max": 0.9127425730228425,
"sampling/sampling_logp_difference/mean": 0.003781242948025465,
"step": 15670,
"step_time": 5.800863980906433
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1010.4,
"completions/max_terminated_length": 946.3,
"completions/mean_length": 142.944921875,
"completions/mean_terminated_length": 141.47684783935546,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.0353489876491949,
"epoch": 33.57601713062098,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.1650390625,
"learning_rate": 8.4321e-06,
"loss": -0.0045,
"num_tokens": 1531026812.0,
"reward": 1.0608789265155791,
"reward_std": 0.14337778985500335,
"rewards/reward_accuracy/mean": 0.9609375,
"rewards/reward_accuracy/std": 0.14331778064370154,
"rewards/reward_format/mean": 0.09994140714406967,
"rewards/reward_format/std": 0.0007535743294283748,
"sampling/importance_sampling_ratio/max": 2.467592489719391,
"sampling/importance_sampling_ratio/mean": 1.005700707435608,
"sampling/importance_sampling_ratio/min": 0.17324309330433607,
"sampling/sampling_logp_difference/max": 1.1031181573867799,
"sampling/sampling_logp_difference/mean": 0.003674219036474824,
"step": 15680,
"step_time": 5.190362657094374
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1573.1,
"completions/max_terminated_length": 1369.0,
"completions/mean_length": 184.028125,
"completions/mean_terminated_length": 171.67553253173827,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.0479984660865739,
"epoch": 33.59743040685225,
"frac_reward_zero_std": 0.88125,
"grad_norm": 0.431640625,
"learning_rate": 8.431100000000001e-06,
"loss": -0.0024,
"num_tokens": 1532024836.0,
"reward": 1.052988314628601,
"reward_std": 0.16925925835967065,
"rewards/reward_accuracy/mean": 0.953515625,
"rewards/reward_accuracy/std": 0.16700486913323404,
"rewards/reward_format/mean": 0.09947265833616256,
"rewards/reward_format/std": 0.005161701282486319,
"sampling/importance_sampling_ratio/max": 2.5034685015678404,
"sampling/importance_sampling_ratio/mean": 0.9763666272163392,
"sampling/importance_sampling_ratio/min": 0.04848799556493759,
"sampling/sampling_logp_difference/max": 1.1294761657714845,
"sampling/sampling_logp_difference/mean": 0.004109005001373589,
"step": 15690,
"step_time": 7.78049962669611
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1081.3,
"completions/max_terminated_length": 835.3,
"completions/mean_length": 140.141015625,
"completions/mean_terminated_length": 138.64953155517577,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.03360716998577118,
"epoch": 33.61884368308351,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.65234375,
"learning_rate": 8.4301e-06,
"loss": -0.0015,
"num_tokens": 1532897485.0,
"reward": 1.0792187571525573,
"reward_std": 0.10223338261712342,
"rewards/reward_accuracy/mean": 0.979296875,
"rewards/reward_accuracy/std": 0.1014670453965664,
"rewards/reward_format/mean": 0.09992187544703483,
"rewards/reward_format/std": 0.0012500000651925803,
"sampling/importance_sampling_ratio/max": 2.3755987644195558,
"sampling/importance_sampling_ratio/mean": 0.9970045804977417,
"sampling/importance_sampling_ratio/min": 0.21761137396097183,
"sampling/sampling_logp_difference/max": 1.0297537684440612,
"sampling/sampling_logp_difference/mean": 0.003689264412969351,
"step": 15700,
"step_time": 5.2692631881975105
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 833.0,
"completions/max_terminated_length": 780.3,
"completions/mean_length": 133.3171875,
"completions/mean_terminated_length": 131.08596649169922,
"completions/min_length": 62.3,
"completions/min_terminated_length": 62.3,
"entropy": 0.03487586413975805,
"epoch": 33.640256959314776,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.275390625,
"learning_rate": 8.4291e-06,
"loss": -0.004,
"num_tokens": 1533756937.0,
"reward": 1.0944336175918579,
"reward_std": 0.05669101923704147,
"rewards/reward_accuracy/mean": 0.99453125,
"rewards/reward_accuracy/std": 0.055923495441675186,
"rewards/reward_format/mean": 0.09990234524011612,
"rewards/reward_format/std": 0.0011641392018646001,
"sampling/importance_sampling_ratio/max": 2.489329159259796,
"sampling/importance_sampling_ratio/mean": 0.9974363267421722,
"sampling/importance_sampling_ratio/min": 0.22540783029980957,
"sampling/sampling_logp_difference/max": 0.9563681483268738,
"sampling/sampling_logp_difference/mean": 0.003538421425037086,
"step": 15710,
"step_time": 4.2460815647937125
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1607.6,
"completions/max_terminated_length": 1167.9,
"completions/mean_length": 161.25703125,
"completions/mean_terminated_length": 152.37261657714845,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.04146127726417035,
"epoch": 33.66167023554604,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.203125,
"learning_rate": 8.4281e-06,
"loss": -0.0051,
"num_tokens": 1534693483.0,
"reward": 1.0387695550918579,
"reward_std": 0.22184593975543976,
"rewards/reward_accuracy/mean": 0.9390625,
"rewards/reward_accuracy/std": 0.21994568929076194,
"rewards/reward_format/mean": 0.09970703274011612,
"rewards/reward_format/std": 0.0029110706644132735,
"sampling/importance_sampling_ratio/max": 2.536005735397339,
"sampling/importance_sampling_ratio/mean": 0.9880561709403992,
"sampling/importance_sampling_ratio/min": 0.03123031500726938,
"sampling/sampling_logp_difference/max": 1.149131178855896,
"sampling/sampling_logp_difference/mean": 0.003949470212683081,
"step": 15720,
"step_time": 7.815185864112573
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1186.7,
"completions/max_terminated_length": 1049.0,
"completions/mean_length": 147.92734375,
"completions/mean_terminated_length": 141.34533233642577,
"completions/min_length": 62.8,
"completions/min_terminated_length": 62.8,
"entropy": 0.03565325504168868,
"epoch": 33.683083511777305,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.125,
"learning_rate": 8.427100000000001e-06,
"loss": -0.0052,
"num_tokens": 1535589441.0,
"reward": 1.0770312666893005,
"reward_std": 0.1062884122133255,
"rewards/reward_accuracy/mean": 0.97734375,
"rewards/reward_accuracy/std": 0.10492929890751838,
"rewards/reward_format/mean": 0.09968750104308129,
"rewards/reward_format/std": 0.0025158039759844543,
"sampling/importance_sampling_ratio/max": 2.7220169067382813,
"sampling/importance_sampling_ratio/mean": 0.9930950284004212,
"sampling/importance_sampling_ratio/min": 0.13217363953590394,
"sampling/sampling_logp_difference/max": 1.0508686304092407,
"sampling/sampling_logp_difference/mean": 0.0037206053268164395,
"step": 15730,
"step_time": 5.844828071608208
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1290.6,
"completions/max_terminated_length": 983.7,
"completions/mean_length": 164.507421875,
"completions/mean_terminated_length": 157.18643646240236,
"completions/min_length": 65.7,
"completions/min_terminated_length": 65.7,
"entropy": 0.040926715522073207,
"epoch": 33.70449678800856,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.609375,
"learning_rate": 8.4261e-06,
"loss": -0.0054,
"num_tokens": 1536520692.0,
"reward": 1.0566797018051148,
"reward_std": 0.164938011020422,
"rewards/reward_accuracy/mean": 0.95703125,
"rewards/reward_accuracy/std": 0.16372816935181617,
"rewards/reward_format/mean": 0.09964843839406967,
"rewards/reward_format/std": 0.0036277435021474956,
"sampling/importance_sampling_ratio/max": 2.457803285121918,
"sampling/importance_sampling_ratio/mean": 0.9873347282409668,
"sampling/importance_sampling_ratio/min": 0.07313869297504424,
"sampling/sampling_logp_difference/max": 1.0750716865062713,
"sampling/sampling_logp_difference/mean": 0.003964539314620197,
"step": 15740,
"step_time": 6.40301420520409
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 729.8,
"completions/max_terminated_length": 729.8,
"completions/mean_length": 132.283984375,
"completions/mean_terminated_length": 132.283984375,
"completions/min_length": 61.3,
"completions/min_terminated_length": 61.3,
"entropy": 0.029558208608068525,
"epoch": 33.72591006423983,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.2421875,
"learning_rate": 8.4251e-06,
"loss": 0.0017,
"num_tokens": 1537367595.0,
"reward": 1.0906054854393006,
"reward_std": 0.059112010151147844,
"rewards/reward_accuracy/mean": 0.990625,
"rewards/reward_accuracy/std": 0.05892931893467903,
"rewards/reward_format/mean": 0.09998046979308128,
"rewards/reward_format/std": 0.0003125000046566129,
"sampling/importance_sampling_ratio/max": 2.512445867061615,
"sampling/importance_sampling_ratio/mean": 0.9936835110187531,
"sampling/importance_sampling_ratio/min": 0.2599779449403286,
"sampling/sampling_logp_difference/max": 0.9116616010665893,
"sampling/sampling_logp_difference/mean": 0.003431620821356773,
"step": 15750,
"step_time": 3.858581613222486
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1316.2,
"completions/max_terminated_length": 941.1,
"completions/mean_length": 155.85703125,
"completions/mean_terminated_length": 141.86067657470704,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.037652339111082254,
"epoch": 33.74732334047109,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.3203125,
"learning_rate": 8.424100000000001e-06,
"loss": -0.007,
"num_tokens": 1538274845.0,
"reward": 1.0753906607627868,
"reward_std": 0.12365757450461387,
"rewards/reward_accuracy/mean": 0.97578125,
"rewards/reward_accuracy/std": 0.12166690826416016,
"rewards/reward_format/mean": 0.09960937723517418,
"rewards/reward_format/std": 0.003005386516451836,
"sampling/importance_sampling_ratio/max": 2.6237855911254884,
"sampling/importance_sampling_ratio/mean": 1.0001077473163604,
"sampling/importance_sampling_ratio/min": 0.12548161894083024,
"sampling/sampling_logp_difference/max": 0.9152984738349914,
"sampling/sampling_logp_difference/mean": 0.0037597658345475795,
"step": 15760,
"step_time": 6.500347047418472
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1084.3,
"completions/max_terminated_length": 1076.3,
"completions/mean_length": 146.645703125,
"completions/mean_terminated_length": 144.41419830322266,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.038387073390185836,
"epoch": 33.768736616702355,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.302734375,
"learning_rate": 8.4231e-06,
"loss": -0.0048,
"num_tokens": 1539169138.0,
"reward": 1.0804101705551148,
"reward_std": 0.09601515114773065,
"rewards/reward_accuracy/mean": 0.98046875,
"rewards/reward_accuracy/std": 0.09547502249479294,
"rewards/reward_format/mean": 0.09994140714406967,
"rewards/reward_format/std": 0.0009375000605359674,
"sampling/importance_sampling_ratio/max": 2.5742848396301268,
"sampling/importance_sampling_ratio/mean": 0.9955775499343872,
"sampling/importance_sampling_ratio/min": 0.12840893864631653,
"sampling/sampling_logp_difference/max": 1.1168839454650878,
"sampling/sampling_logp_difference/mean": 0.004086605319753289,
"step": 15770,
"step_time": 5.290367297903868
},
{
"clip_ratio/high_max": 3.032132372027263e-05,
"clip_ratio/high_mean": 3.790165465034079e-06,
"clip_ratio/low_mean": 1.1892834208993008e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.97944888593338e-06,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1273.1,
"completions/max_terminated_length": 1187.4,
"completions/mean_length": 147.703125,
"completions/mean_terminated_length": 136.55470275878906,
"completions/min_length": 58.9,
"completions/min_terminated_length": 58.9,
"entropy": 0.038775274599902335,
"epoch": 33.79014989293362,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.052978515625,
"learning_rate": 8.4221e-06,
"loss": -0.0067,
"num_tokens": 1540061482.0,
"reward": 1.0504297018051147,
"reward_std": 0.1845210845815018,
"rewards/reward_accuracy/mean": 0.95078125,
"rewards/reward_accuracy/std": 0.18289679735898973,
"rewards/reward_format/mean": 0.09964843839406967,
"rewards/reward_format/std": 0.002638956531882286,
"sampling/importance_sampling_ratio/max": 2.395116400718689,
"sampling/importance_sampling_ratio/mean": 0.998455160856247,
"sampling/importance_sampling_ratio/min": 0.1690031338483095,
"sampling/sampling_logp_difference/max": 1.0642981052398681,
"sampling/sampling_logp_difference/mean": 0.0038199572591111064,
"step": 15780,
"step_time": 6.369334122605506
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1538.0,
"completions/max_terminated_length": 1153.4,
"completions/mean_length": 170.7875,
"completions/mean_terminated_length": 161.95120544433593,
"completions/min_length": 68.6,
"completions/min_terminated_length": 68.6,
"entropy": 0.0457858192268759,
"epoch": 33.811563169164884,
"frac_reward_zero_std": 0.9,
"grad_norm": 1.125,
"learning_rate": 8.421100000000001e-06,
"loss": 0.0078,
"num_tokens": 1541019722.0,
"reward": 1.0524023592472076,
"reward_std": 0.17677870243787766,
"rewards/reward_accuracy/mean": 0.952734375,
"rewards/reward_accuracy/std": 0.1757963478565216,
"rewards/reward_format/mean": 0.09966796785593032,
"rewards/reward_format/std": 0.0035196532029658557,
"sampling/importance_sampling_ratio/max": 2.324246680736542,
"sampling/importance_sampling_ratio/mean": 0.9873859107494354,
"sampling/importance_sampling_ratio/min": 0.11139944065362214,
"sampling/sampling_logp_difference/max": 1.0974258184432983,
"sampling/sampling_logp_difference/mean": 0.004142144112847745,
"step": 15790,
"step_time": 7.409425829307293
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1845.2,
"completions/max_terminated_length": 1202.5,
"completions/mean_length": 156.843359375,
"completions/mean_terminated_length": 147.2149856567383,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.04051266785245389,
"epoch": 33.83297644539615,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.2431640625,
"learning_rate": 8.420100000000001e-06,
"loss": -0.004,
"num_tokens": 1541942857.0,
"reward": 1.0652734577655791,
"reward_std": 0.14288109987974168,
"rewards/reward_accuracy/mean": 0.965625,
"rewards/reward_accuracy/std": 0.14083538576960564,
"rewards/reward_format/mean": 0.09964843839406967,
"rewards/reward_format/std": 0.0036014132434502243,
"sampling/importance_sampling_ratio/max": 2.501971185207367,
"sampling/importance_sampling_ratio/mean": 0.9841910600662231,
"sampling/importance_sampling_ratio/min": 0.0927305968478322,
"sampling/sampling_logp_difference/max": 0.9954662919044495,
"sampling/sampling_logp_difference/mean": 0.0038634657859802244,
"step": 15800,
"step_time": 8.518008003087015
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1129.1,
"completions/max_terminated_length": 1053.8,
"completions/mean_length": 154.10546875,
"completions/mean_terminated_length": 147.57539978027344,
"completions/min_length": 62.8,
"completions/min_terminated_length": 62.8,
"entropy": 0.04146480250637978,
"epoch": 33.854389721627406,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.28125,
"learning_rate": 8.4191e-06,
"loss": -0.0066,
"num_tokens": 1542854471.0,
"reward": 1.0694726586341858,
"reward_std": 0.12318191528320313,
"rewards/reward_accuracy/mean": 0.969921875,
"rewards/reward_accuracy/std": 0.12104755714535713,
"rewards/reward_format/mean": 0.0995507813990116,
"rewards/reward_format/std": 0.003926109452731907,
"sampling/importance_sampling_ratio/max": 2.5743033409118654,
"sampling/importance_sampling_ratio/mean": 0.9948233783245086,
"sampling/importance_sampling_ratio/min": 0.09485166072845459,
"sampling/sampling_logp_difference/max": 1.0433502674102784,
"sampling/sampling_logp_difference/mean": 0.004179661651141942,
"step": 15810,
"step_time": 5.7710079391021285
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1360.0,
"completions/max_terminated_length": 1250.8,
"completions/mean_length": 166.838671875,
"completions/mean_terminated_length": 155.8644989013672,
"completions/min_length": 60.2,
"completions/min_terminated_length": 60.2,
"entropy": 0.0396261194953695,
"epoch": 33.87580299785867,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.54296875,
"learning_rate": 8.4181e-06,
"loss": 0.0006,
"num_tokens": 1543799306.0,
"reward": 1.054941439628601,
"reward_std": 0.16484254151582717,
"rewards/reward_accuracy/mean": 0.95546875,
"rewards/reward_accuracy/std": 0.1628672733902931,
"rewards/reward_format/mean": 0.09947265833616256,
"rewards/reward_format/std": 0.004569036280736327,
"sampling/importance_sampling_ratio/max": 2.3608781814575197,
"sampling/importance_sampling_ratio/mean": 0.9864245891571045,
"sampling/importance_sampling_ratio/min": 0.0758115865290165,
"sampling/sampling_logp_difference/max": 0.9618160486221313,
"sampling/sampling_logp_difference/mean": 0.003697440191172063,
"step": 15820,
"step_time": 6.807810882508056
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1371.8,
"completions/max_terminated_length": 1220.4,
"completions/mean_length": 180.1453125,
"completions/mean_terminated_length": 167.04597015380858,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"entropy": 0.043320285412482916,
"epoch": 33.897216274089935,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.6796875,
"learning_rate": 8.417100000000001e-06,
"loss": -0.0046,
"num_tokens": 1544785822.0,
"reward": 1.0658008098602294,
"reward_std": 0.1489630676805973,
"rewards/reward_accuracy/mean": 0.96640625,
"rewards/reward_accuracy/std": 0.14700063019990922,
"rewards/reward_format/mean": 0.09939453154802322,
"rewards/reward_format/std": 0.004314637230709195,
"sampling/importance_sampling_ratio/max": 2.4438926458358763,
"sampling/importance_sampling_ratio/mean": 0.9844156801700592,
"sampling/importance_sampling_ratio/min": 0.13534865379333497,
"sampling/sampling_logp_difference/max": 1.1850386619567872,
"sampling/sampling_logp_difference/mean": 0.0039394727209582925,
"step": 15830,
"step_time": 6.840625097398879
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1236.8,
"completions/max_terminated_length": 1145.2,
"completions/mean_length": 147.043359375,
"completions/mean_terminated_length": 140.36733474731446,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.03739469952415675,
"epoch": 33.9186295503212,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0,
"learning_rate": 8.4161e-06,
"loss": -0.0044,
"num_tokens": 1545677709.0,
"reward": 1.0704687714576722,
"reward_std": 0.13188396990299225,
"rewards/reward_accuracy/mean": 0.970703125,
"rewards/reward_accuracy/std": 0.13058871403336525,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0024110510013997553,
"sampling/importance_sampling_ratio/max": 2.2385746717453,
"sampling/importance_sampling_ratio/mean": 0.9897590219974518,
"sampling/importance_sampling_ratio/min": 0.1022606361657381,
"sampling/sampling_logp_difference/max": 1.131439447402954,
"sampling/sampling_logp_difference/mean": 0.003635389916598797,
"step": 15840,
"step_time": 6.214495090491255
},
{
"clip_ratio/high_max": 0.00014978402177803218,
"clip_ratio/high_mean": 1.8723002722254022e-05,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.8723002722254022e-05,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 911.3,
"completions/max_terminated_length": 889.7,
"completions/mean_length": 144.1421875,
"completions/mean_terminated_length": 143.41554412841796,
"completions/min_length": 69.4,
"completions/min_terminated_length": 69.4,
"entropy": 0.03453121823258698,
"epoch": 33.940042826552464,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.0,
"learning_rate": 8.4151e-06,
"loss": -0.002,
"num_tokens": 1546572217.0,
"reward": 1.0761133074760436,
"reward_std": 0.09985153451561928,
"rewards/reward_accuracy/mean": 0.976171875,
"rewards/reward_accuracy/std": 0.09972807243466378,
"rewards/reward_format/mean": 0.09994140788912773,
"rewards/reward_format/std": 0.0006976743228733539,
"sampling/importance_sampling_ratio/max": 2.3013684272766115,
"sampling/importance_sampling_ratio/mean": 0.9925741493701935,
"sampling/importance_sampling_ratio/min": 0.13345409631729127,
"sampling/sampling_logp_difference/max": 0.8856019973754883,
"sampling/sampling_logp_difference/mean": 0.0036997859366238116,
"step": 15850,
"step_time": 4.598055321004358
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1057.2,
"completions/max_terminated_length": 957.2,
"completions/mean_length": 143.7515625,
"completions/mean_terminated_length": 141.55484771728516,
"completions/min_length": 64.4,
"completions/min_terminated_length": 64.4,
"entropy": 0.036260483087971807,
"epoch": 33.96145610278373,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.2578125,
"learning_rate": 8.414100000000001e-06,
"loss": -0.0041,
"num_tokens": 1547451453.0,
"reward": 1.0550000190734863,
"reward_std": 0.1820862352848053,
"rewards/reward_accuracy/mean": 0.955078125,
"rewards/reward_accuracy/std": 0.18180495649576187,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.0010660743806511163,
"sampling/importance_sampling_ratio/max": 2.5251001477241517,
"sampling/importance_sampling_ratio/mean": 0.9989038228988647,
"sampling/importance_sampling_ratio/min": 0.14155374094843864,
"sampling/sampling_logp_difference/max": 1.104555368423462,
"sampling/sampling_logp_difference/mean": 0.00379797478672117,
"step": 15860,
"step_time": 5.279192802988109
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 1084.6,
"completions/max_terminated_length": 898.8,
"completions/mean_length": 144.892578125,
"completions/mean_terminated_length": 144.13697509765626,
"completions/min_length": 70.7,
"completions/min_terminated_length": 70.7,
"entropy": 0.03592145766597241,
"epoch": 33.98286937901499,
"frac_reward_zero_std": 0.9,
"grad_norm": 1.1171875,
"learning_rate": 8.4131e-06,
"loss": -0.0019,
"num_tokens": 1548338298.0,
"reward": 1.0835351705551148,
"reward_std": 0.09530943483114243,
"rewards/reward_accuracy/mean": 0.98359375,
"rewards/reward_accuracy/std": 0.09462199062108993,
"rewards/reward_format/mean": 0.09994140714406967,
"rewards/reward_format/std": 0.0009375000605359674,
"sampling/importance_sampling_ratio/max": 2.621462869644165,
"sampling/importance_sampling_ratio/mean": 1.007897400856018,
"sampling/importance_sampling_ratio/min": 0.21660336554050447,
"sampling/sampling_logp_difference/max": 1.0186576128005982,
"sampling/sampling_logp_difference/mean": 0.0039421940920874475,
"step": 15870,
"step_time": 5.261191323780804
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 975.3,
"completions/max_terminated_length": 900.5,
"completions/mean_length": 161.343359375,
"completions/mean_terminated_length": 151.99954833984376,
"completions/min_length": 62.4,
"completions/min_terminated_length": 62.4,
"entropy": 0.04361795550212264,
"epoch": 34.00428265524625,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.314453125,
"learning_rate": 8.4121e-06,
"loss": -0.0019,
"num_tokens": 1549268841.0,
"reward": 1.0777734518051147,
"reward_std": 0.08910081386566163,
"rewards/reward_accuracy/mean": 0.978125,
"rewards/reward_accuracy/std": 0.08800128400325775,
"rewards/reward_format/mean": 0.09964843839406967,
"rewards/reward_format/std": 0.0025979127967730165,
"sampling/importance_sampling_ratio/max": 2.3710811257362367,
"sampling/importance_sampling_ratio/mean": 0.9834049940109253,
"sampling/importance_sampling_ratio/min": 0.06083831340074539,
"sampling/sampling_logp_difference/max": 1.0336459159851075,
"sampling/sampling_logp_difference/mean": 0.004019369790330529,
"step": 15880,
"step_time": 5.147004280489637
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1485.8,
"completions/max_terminated_length": 1322.1,
"completions/mean_length": 161.16640625,
"completions/mean_terminated_length": 156.76715240478515,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.04362169736996293,
"epoch": 34.025695931477514,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.411100000000002e-06,
"loss": -0.0027,
"num_tokens": 1550212435.0,
"reward": 1.08369140625,
"reward_std": 0.09740320295095443,
"rewards/reward_accuracy/mean": 0.983984375,
"rewards/reward_accuracy/std": 0.09527873098850251,
"rewards/reward_format/mean": 0.09970703125,
"rewards/reward_format/std": 0.0038753008469939233,
"sampling/importance_sampling_ratio/max": 2.494776129722595,
"sampling/importance_sampling_ratio/mean": 0.988626879453659,
"sampling/importance_sampling_ratio/min": 0.1684450825676322,
"sampling/sampling_logp_difference/max": 1.0475051879882813,
"sampling/sampling_logp_difference/mean": 0.003897975804284215,
"step": 15890,
"step_time": 7.313551332007046
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1677.8,
"completions/max_terminated_length": 1344.6,
"completions/mean_length": 156.637890625,
"completions/mean_terminated_length": 144.02641754150392,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.04232143822591752,
"epoch": 34.04710920770878,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.1689453125,
"learning_rate": 8.410100000000001e-06,
"loss": -0.0042,
"num_tokens": 1551134548.0,
"reward": 1.0729687571525575,
"reward_std": 0.129569610953331,
"rewards/reward_accuracy/mean": 0.9734375,
"rewards/reward_accuracy/std": 0.12744625136256219,
"rewards/reward_format/mean": 0.09953125044703484,
"rewards/reward_format/std": 0.00392670757137239,
"sampling/importance_sampling_ratio/max": 2.393895947933197,
"sampling/importance_sampling_ratio/mean": 0.9845734298229217,
"sampling/importance_sampling_ratio/min": 0.12432486414909363,
"sampling/sampling_logp_difference/max": 0.9150558829307556,
"sampling/sampling_logp_difference/mean": 0.0037966437404975293,
"step": 15900,
"step_time": 8.199960121905315
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1176.7,
"completions/max_terminated_length": 1036.4,
"completions/mean_length": 148.770703125,
"completions/mean_terminated_length": 141.4779067993164,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.03511536319274455,
"epoch": 34.06852248394004,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0615234375,
"learning_rate": 8.4091e-06,
"loss": -0.0052,
"num_tokens": 1552035849.0,
"reward": 1.072812521457672,
"reward_std": 0.11764153242111205,
"rewards/reward_accuracy/mean": 0.973046875,
"rewards/reward_accuracy/std": 0.1164311058819294,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0027538751484826205,
"sampling/importance_sampling_ratio/max": 2.5481075286865233,
"sampling/importance_sampling_ratio/mean": 0.9995423018932342,
"sampling/importance_sampling_ratio/min": 0.14041961953043938,
"sampling/sampling_logp_difference/max": 0.8485879242420197,
"sampling/sampling_logp_difference/mean": 0.003766522742807865,
"step": 15910,
"step_time": 5.939137347901124
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 760.6,
"completions/max_terminated_length": 727.2,
"completions/mean_length": 139.53671875,
"completions/mean_terminated_length": 136.60477600097656,
"completions/min_length": 62.1,
"completions/min_terminated_length": 62.1,
"entropy": 0.032944238488562406,
"epoch": 34.08993576017131,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.1787109375,
"learning_rate": 8.4081e-06,
"loss": -0.0028,
"num_tokens": 1552900295.0,
"reward": 1.0767968893051147,
"reward_std": 0.08754099488724024,
"rewards/reward_accuracy/mean": 0.976953125,
"rewards/reward_accuracy/std": 0.08686792105436325,
"rewards/reward_format/mean": 0.09984375089406967,
"rewards/reward_format/std": 0.0014331000158563257,
"sampling/importance_sampling_ratio/max": 2.519249105453491,
"sampling/importance_sampling_ratio/mean": 0.9926102578639984,
"sampling/importance_sampling_ratio/min": 0.26331781446933744,
"sampling/sampling_logp_difference/max": 0.9679141163825988,
"sampling/sampling_logp_difference/mean": 0.003724357020109892,
"step": 15920,
"step_time": 4.043900561399641
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1297.8,
"completions/max_terminated_length": 1095.3,
"completions/mean_length": 161.769140625,
"completions/mean_terminated_length": 153.70806274414062,
"completions/min_length": 67.5,
"completions/min_terminated_length": 67.5,
"entropy": 0.04290665129665285,
"epoch": 34.11134903640257,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.76171875,
"learning_rate": 8.4071e-06,
"loss": -0.0043,
"num_tokens": 1553835736.0,
"reward": 1.0445898711681365,
"reward_std": 0.18749339878559113,
"rewards/reward_accuracy/mean": 0.944921875,
"rewards/reward_accuracy/std": 0.18597693964838982,
"rewards/reward_format/mean": 0.09966797083616256,
"rewards/reward_format/std": 0.004097145958803594,
"sampling/importance_sampling_ratio/max": 2.3708810806274414,
"sampling/importance_sampling_ratio/mean": 0.9892857611179352,
"sampling/importance_sampling_ratio/min": 0.07040365412831306,
"sampling/sampling_logp_difference/max": 1.1933933734893798,
"sampling/sampling_logp_difference/mean": 0.004004558711312711,
"step": 15930,
"step_time": 6.396261447688448
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1165.0,
"completions/max_terminated_length": 969.8,
"completions/mean_length": 160.6125,
"completions/mean_terminated_length": 153.3472137451172,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.04044304918497801,
"epoch": 34.13276231263383,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.59765625,
"learning_rate": 8.4061e-06,
"loss": -0.0021,
"num_tokens": 1554762536.0,
"reward": 1.059824240207672,
"reward_std": 0.1671535886824131,
"rewards/reward_accuracy/mean": 0.96015625,
"rewards/reward_accuracy/std": 0.1655910536646843,
"rewards/reward_format/mean": 0.09966796934604645,
"rewards/reward_format/std": 0.003209052630700171,
"sampling/importance_sampling_ratio/max": 2.4587535858154297,
"sampling/importance_sampling_ratio/mean": 0.984615969657898,
"sampling/importance_sampling_ratio/min": 0.0975650891661644,
"sampling/sampling_logp_difference/max": 0.8387087941169739,
"sampling/sampling_logp_difference/mean": 0.003931131074205041,
"step": 15940,
"step_time": 5.916208765501506
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 988.1,
"completions/max_terminated_length": 691.4,
"completions/mean_length": 139.962890625,
"completions/mean_terminated_length": 137.73201751708984,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"entropy": 0.03229325448628515,
"epoch": 34.154175588865094,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.1494140625,
"learning_rate": 8.4051e-06,
"loss": -0.0066,
"num_tokens": 1555635433.0,
"reward": 1.0772656440734862,
"reward_std": 0.10769757702946663,
"rewards/reward_accuracy/mean": 0.97734375,
"rewards/reward_accuracy/std": 0.10692307502031326,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.0012500001117587089,
"sampling/importance_sampling_ratio/max": 2.473639738559723,
"sampling/importance_sampling_ratio/mean": 1.005414229631424,
"sampling/importance_sampling_ratio/min": 0.19479365795850753,
"sampling/sampling_logp_difference/max": 0.8436864256858826,
"sampling/sampling_logp_difference/mean": 0.003598675737157464,
"step": 15950,
"step_time": 4.778453679496306
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1149.3,
"completions/max_terminated_length": 995.7,
"completions/mean_length": 149.54609375,
"completions/mean_terminated_length": 142.8701599121094,
"completions/min_length": 61.6,
"completions/min_terminated_length": 61.6,
"entropy": 0.038888661307282746,
"epoch": 34.17558886509636,
"frac_reward_zero_std": 0.95,
"grad_norm": 1.2734375,
"learning_rate": 8.404100000000001e-06,
"loss": -0.0045,
"num_tokens": 1556532031.0,
"reward": 1.085351586341858,
"reward_std": 0.08288926631212234,
"rewards/reward_accuracy/mean": 0.985546875,
"rewards/reward_accuracy/std": 0.08184266164898872,
"rewards/reward_format/mean": 0.09980468899011612,
"rewards/reward_format/std": 0.0025173231260851026,
"sampling/importance_sampling_ratio/max": 2.454957115650177,
"sampling/importance_sampling_ratio/mean": 0.9820002496242524,
"sampling/importance_sampling_ratio/min": 0.18519899882376195,
"sampling/sampling_logp_difference/max": 0.9857999086380005,
"sampling/sampling_logp_difference/mean": 0.004000566550530493,
"step": 15960,
"step_time": 5.792575803401997
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1273.5,
"completions/max_terminated_length": 1024.7,
"completions/mean_length": 140.12578125,
"completions/mean_terminated_length": 138.6391159057617,
"completions/min_length": 62.3,
"completions/min_terminated_length": 62.3,
"entropy": 0.035579075640998784,
"epoch": 34.19700214132762,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.3203125,
"learning_rate": 8.403100000000001e-06,
"loss": -0.0027,
"num_tokens": 1557405393.0,
"reward": 1.0843554854393005,
"reward_std": 0.09677987024188042,
"rewards/reward_accuracy/mean": 0.984375,
"rewards/reward_accuracy/std": 0.09646737277507782,
"rewards/reward_format/mean": 0.09998046979308128,
"rewards/reward_format/std": 0.0003125000046566129,
"sampling/importance_sampling_ratio/max": 2.601102113723755,
"sampling/importance_sampling_ratio/mean": 0.9890960037708283,
"sampling/importance_sampling_ratio/min": 0.11486774086952209,
"sampling/sampling_logp_difference/max": 1.2796175837516786,
"sampling/sampling_logp_difference/mean": 0.003919307538308203,
"step": 15970,
"step_time": 6.035174532706151
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 874.5,
"completions/max_terminated_length": 856.3,
"completions/mean_length": 147.179296875,
"completions/mean_terminated_length": 146.43978576660157,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.03311580833978951,
"epoch": 34.21841541755889,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.2333984375,
"learning_rate": 8.4021e-06,
"loss": 0.0003,
"num_tokens": 1558302700.0,
"reward": 1.0835156440734863,
"reward_std": 0.08064092129934579,
"rewards/reward_accuracy/mean": 0.98359375,
"rewards/reward_accuracy/std": 0.0800995908677578,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.001010174280963838,
"sampling/importance_sampling_ratio/max": 2.3865211963653565,
"sampling/importance_sampling_ratio/mean": 0.9990239262580871,
"sampling/importance_sampling_ratio/min": 0.23313820958137513,
"sampling/sampling_logp_difference/max": 0.9724297821521759,
"sampling/sampling_logp_difference/mean": 0.003575699171051383,
"step": 15980,
"step_time": 4.295019346507615
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1020.7,
"completions/max_terminated_length": 931.6,
"completions/mean_length": 155.28515625,
"completions/mean_terminated_length": 145.80186767578124,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.03973747291602194,
"epoch": 34.23982869379015,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0,
"learning_rate": 8.401100000000002e-06,
"loss": 0.0,
"num_tokens": 1559210630.0,
"reward": 1.071464866399765,
"reward_std": 0.10260616168379784,
"rewards/reward_accuracy/mean": 0.971875,
"rewards/reward_accuracy/std": 0.10188135877251625,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.002854176051914692,
"sampling/importance_sampling_ratio/max": 2.584211754798889,
"sampling/importance_sampling_ratio/mean": 0.9876089632511139,
"sampling/importance_sampling_ratio/min": 0.18422046676278114,
"sampling/sampling_logp_difference/max": 0.9336146175861358,
"sampling/sampling_logp_difference/mean": 0.003519516112282872,
"step": 15990,
"step_time": 5.340041447401745
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1127.3,
"completions/max_terminated_length": 916.9,
"completions/mean_length": 150.748828125,
"completions/mean_terminated_length": 148.51742553710938,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.036685016192495826,
"epoch": 34.261241970021416,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.2158203125,
"learning_rate": 8.400100000000001e-06,
"loss": 0.0011,
"num_tokens": 1560112803.0,
"reward": 1.067871105670929,
"reward_std": 0.13576003566849976,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.1351088725030422,
"rewards/reward_format/mean": 0.09990234449505805,
"rewards/reward_format/std": 0.001562500116415322,
"sampling/importance_sampling_ratio/max": 2.5288784742355346,
"sampling/importance_sampling_ratio/mean": 0.9940587878227234,
"sampling/importance_sampling_ratio/min": 0.16501252502202987,
"sampling/sampling_logp_difference/max": 0.9682760179042816,
"sampling/sampling_logp_difference/mean": 0.003753247344866395,
"step": 16000,
"step_time": 5.467206508887466
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 873.8,
"completions/max_terminated_length": 754.1,
"completions/mean_length": 156.66171875,
"completions/mean_terminated_length": 145.09713134765624,
"completions/min_length": 63.5,
"completions/min_terminated_length": 63.5,
"entropy": 0.036085558985359964,
"epoch": 34.28265524625267,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.3991e-06,
"loss": -0.0061,
"num_tokens": 1561031905.0,
"reward": 1.078906273841858,
"reward_std": 0.09470519945025443,
"rewards/reward_accuracy/mean": 0.979296875,
"rewards/reward_accuracy/std": 0.0933746837079525,
"rewards/reward_format/mean": 0.09960937649011611,
"rewards/reward_format/std": 0.0023646473884582518,
"sampling/importance_sampling_ratio/max": 2.6079225182533263,
"sampling/importance_sampling_ratio/mean": 0.9957319617271423,
"sampling/importance_sampling_ratio/min": 0.15865231435745955,
"sampling/sampling_logp_difference/max": 1.04581139087677,
"sampling/sampling_logp_difference/mean": 0.003582767257466912,
"step": 16010,
"step_time": 4.68082040809386
},
{
"clip_ratio/high_max": 1.9380945013836025e-05,
"clip_ratio/high_mean": 2.422618126729503e-06,
"clip_ratio/low_mean": 9.789408295546309e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.401558956284134e-06,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 882.6,
"completions/max_terminated_length": 844.6,
"completions/mean_length": 156.921875,
"completions/mean_terminated_length": 146.65208740234374,
"completions/min_length": 66.6,
"completions/min_terminated_length": 66.6,
"entropy": 0.03715559404809028,
"epoch": 34.30406852248394,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.44921875,
"learning_rate": 8.3981e-06,
"loss": -0.0018,
"num_tokens": 1561955193.0,
"reward": 1.0844531416893006,
"reward_std": 0.0798710823059082,
"rewards/reward_accuracy/mean": 0.984765625,
"rewards/reward_accuracy/std": 0.07873420938849449,
"rewards/reward_format/mean": 0.09968750104308129,
"rewards/reward_format/std": 0.001972912740893662,
"sampling/importance_sampling_ratio/max": 2.513861346244812,
"sampling/importance_sampling_ratio/mean": 0.9898562729358673,
"sampling/importance_sampling_ratio/min": 0.11206884998828173,
"sampling/sampling_logp_difference/max": 1.0769752264022827,
"sampling/sampling_logp_difference/mean": 0.0037702169734984635,
"step": 16020,
"step_time": 4.621894121196237
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1256.6,
"completions/max_terminated_length": 1061.2,
"completions/mean_length": 155.805859375,
"completions/mean_terminated_length": 149.95606842041016,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.040249398560263216,
"epoch": 34.3254817987152,
"frac_reward_zero_std": 0.975,
"grad_norm": 0.0,
"learning_rate": 8.3971e-06,
"loss": -0.0035,
"num_tokens": 1562866216.0,
"reward": 1.0693359613418578,
"reward_std": 0.13678024038672448,
"rewards/reward_accuracy/mean": 0.96953125,
"rewards/reward_accuracy/std": 0.13569534122943877,
"rewards/reward_format/mean": 0.09980468973517417,
"rewards/reward_format/std": 0.0020172667922452093,
"sampling/importance_sampling_ratio/max": 2.5956163883209227,
"sampling/importance_sampling_ratio/mean": 0.9917648077011109,
"sampling/importance_sampling_ratio/min": 0.15527553297579288,
"sampling/sampling_logp_difference/max": 0.8696638107299804,
"sampling/sampling_logp_difference/mean": 0.0038934982847422363,
"step": 16030,
"step_time": 6.1753648990852525
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1257.5,
"completions/max_terminated_length": 1165.1,
"completions/mean_length": 155.5046875,
"completions/mean_terminated_length": 147.41493072509766,
"completions/min_length": 67.3,
"completions/min_terminated_length": 67.3,
"entropy": 0.041977917426265776,
"epoch": 34.34689507494647,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.341796875,
"learning_rate": 8.3961e-06,
"loss": -0.0005,
"num_tokens": 1563780724.0,
"reward": 1.0758008003234862,
"reward_std": 0.11481327190995216,
"rewards/reward_accuracy/mean": 0.976171875,
"rewards/reward_accuracy/std": 0.11309932842850685,
"rewards/reward_format/mean": 0.09962890818715095,
"rewards/reward_format/std": 0.0029796418268233536,
"sampling/importance_sampling_ratio/max": 2.610753297805786,
"sampling/importance_sampling_ratio/mean": 0.9799531996250153,
"sampling/importance_sampling_ratio/min": 0.07281242087483406,
"sampling/sampling_logp_difference/max": 1.0590971112251282,
"sampling/sampling_logp_difference/mean": 0.0041837411699816585,
"step": 16040,
"step_time": 6.264466370994342
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1251.7,
"completions/max_terminated_length": 1189.7,
"completions/mean_length": 161.5625,
"completions/mean_terminated_length": 150.56368408203124,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.04205324549693614,
"epoch": 34.36830835117773,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0,
"learning_rate": 8.3951e-06,
"loss": -0.0069,
"num_tokens": 1564715940.0,
"reward": 1.0788476824760438,
"reward_std": 0.1060407280921936,
"rewards/reward_accuracy/mean": 0.979296875,
"rewards/reward_accuracy/std": 0.10364448726177215,
"rewards/reward_format/mean": 0.09955078288912773,
"rewards/reward_format/std": 0.004142089700326324,
"sampling/importance_sampling_ratio/max": 2.541218137741089,
"sampling/importance_sampling_ratio/mean": 0.9952875196933746,
"sampling/importance_sampling_ratio/min": 0.11232309881597757,
"sampling/sampling_logp_difference/max": 0.9050891935825348,
"sampling/sampling_logp_difference/mean": 0.0037826245417818425,
"step": 16050,
"step_time": 6.2942981557949675
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 973.3,
"completions/max_terminated_length": 831.1,
"completions/mean_length": 144.5640625,
"completions/mean_terminated_length": 142.35389251708983,
"completions/min_length": 65.3,
"completions/min_terminated_length": 65.3,
"entropy": 0.032069319789297876,
"epoch": 34.389721627408996,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.0,
"learning_rate": 8.3941e-06,
"loss": -0.0026,
"num_tokens": 1565607256.0,
"reward": 1.0818945527076722,
"reward_std": 0.08662917912006378,
"rewards/reward_accuracy/mean": 0.98203125,
"rewards/reward_accuracy/std": 0.08565702885389329,
"rewards/reward_format/mean": 0.09986328259110451,
"rewards/reward_format/std": 0.0018196488032117485,
"sampling/importance_sampling_ratio/max": 2.5625462770462035,
"sampling/importance_sampling_ratio/mean": 0.9939753949642182,
"sampling/importance_sampling_ratio/min": 0.18077744208276272,
"sampling/sampling_logp_difference/max": 0.9580687880516052,
"sampling/sampling_logp_difference/mean": 0.0035376028157770635,
"step": 16060,
"step_time": 4.772246252524201
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1411.8,
"completions/max_terminated_length": 1153.1,
"completions/mean_length": 164.55078125,
"completions/mean_terminated_length": 157.29802703857422,
"completions/min_length": 62.7,
"completions/min_terminated_length": 62.7,
"entropy": 0.043240104941651224,
"epoch": 34.41113490364026,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.393100000000001e-06,
"loss": -0.0079,
"num_tokens": 1566547722.0,
"reward": 1.0606445372104645,
"reward_std": 0.124282945250161,
"rewards/reward_accuracy/mean": 0.9609375,
"rewards/reward_accuracy/std": 0.1230269841849804,
"rewards/reward_format/mean": 0.09970703199505807,
"rewards/reward_format/std": 0.003031764458864927,
"sampling/importance_sampling_ratio/max": 2.5727585315704347,
"sampling/importance_sampling_ratio/mean": 0.985068428516388,
"sampling/importance_sampling_ratio/min": 0.14329082071781157,
"sampling/sampling_logp_difference/max": 0.8619545757770538,
"sampling/sampling_logp_difference/mean": 0.0036948875756934287,
"step": 16070,
"step_time": 6.9033686443028275
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1415.9,
"completions/max_terminated_length": 959.2,
"completions/mean_length": 146.37578125,
"completions/mean_terminated_length": 144.12899017333984,
"completions/min_length": 67.2,
"completions/min_terminated_length": 67.2,
"entropy": 0.03519069354515523,
"epoch": 34.43254817987152,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0,
"learning_rate": 8.3921e-06,
"loss": -0.0068,
"num_tokens": 1567436780.0,
"reward": 1.0885546922683715,
"reward_std": 0.06523899168241769,
"rewards/reward_accuracy/mean": 0.988671875,
"rewards/reward_accuracy/std": 0.06386485770344734,
"rewards/reward_format/mean": 0.09988281279802322,
"rewards/reward_format/std": 0.0018750001210719347,
"sampling/importance_sampling_ratio/max": 2.6722617387771606,
"sampling/importance_sampling_ratio/mean": 0.9889939785003662,
"sampling/importance_sampling_ratio/min": 0.13018002063035966,
"sampling/sampling_logp_difference/max": 0.9091616630554199,
"sampling/sampling_logp_difference/mean": 0.0035812468035146595,
"step": 16080,
"step_time": 6.701101708901115
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1061.8,
"completions/max_terminated_length": 883.3,
"completions/mean_length": 144.3265625,
"completions/mean_terminated_length": 140.64983215332032,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"entropy": 0.03461771132424474,
"epoch": 34.45396145610278,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0,
"learning_rate": 8.391100000000002e-06,
"loss": -0.005,
"num_tokens": 1568321360.0,
"reward": 1.077148449420929,
"reward_std": 0.10371746569871902,
"rewards/reward_accuracy/mean": 0.97734375,
"rewards/reward_accuracy/std": 0.10263437032699585,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.0019669008674100042,
"sampling/importance_sampling_ratio/max": 2.481511628627777,
"sampling/importance_sampling_ratio/mean": 0.9959150433540345,
"sampling/importance_sampling_ratio/min": 0.08647757284343242,
"sampling/sampling_logp_difference/max": 1.2185229241847992,
"sampling/sampling_logp_difference/mean": 0.0036540236324071884,
"step": 16090,
"step_time": 5.25035409949196
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1442.1,
"completions/max_terminated_length": 1317.4,
"completions/mean_length": 154.290625,
"completions/mean_terminated_length": 151.35532836914064,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.037683614226989445,
"epoch": 34.475374732334046,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.390100000000001e-06,
"loss": -0.0026,
"num_tokens": 1569238248.0,
"reward": 1.0792382836341858,
"reward_std": 0.11071329519618303,
"rewards/reward_accuracy/mean": 0.979296875,
"rewards/reward_accuracy/std": 0.11026238724589348,
"rewards/reward_format/mean": 0.09994140639901161,
"rewards/reward_format/std": 0.0009375000139698386,
"sampling/importance_sampling_ratio/max": 2.4859166145324707,
"sampling/importance_sampling_ratio/mean": 0.9869338631629944,
"sampling/importance_sampling_ratio/min": 0.11047020889818668,
"sampling/sampling_logp_difference/max": 1.19916689991951,
"sampling/sampling_logp_difference/mean": 0.0038034740602597593,
"step": 16100,
"step_time": 6.899744636201649
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 584.9,
"completions/max_terminated_length": 569.9,
"completions/mean_length": 140.259765625,
"completions/mean_terminated_length": 137.32178955078126,
"completions/min_length": 60.8,
"completions/min_terminated_length": 60.8,
"entropy": 0.030558942607603966,
"epoch": 34.49678800856531,
"frac_reward_zero_std": 0.975,
"grad_norm": 0.0,
"learning_rate": 8.3891e-06,
"loss": -0.0035,
"num_tokens": 1570116161.0,
"reward": 1.0736719012260436,
"reward_std": 0.1108190357685089,
"rewards/reward_accuracy/mean": 0.973828125,
"rewards/reward_accuracy/std": 0.11020855456590653,
"rewards/reward_format/mean": 0.09984375163912773,
"rewards/reward_format/std": 0.0012426253408193589,
"sampling/importance_sampling_ratio/max": 2.5435719728469848,
"sampling/importance_sampling_ratio/mean": 0.9781721234321594,
"sampling/importance_sampling_ratio/min": 0.16193961948156357,
"sampling/sampling_logp_difference/max": 1.0179044961929322,
"sampling/sampling_logp_difference/mean": 0.003495797934010625,
"step": 16110,
"step_time": 3.2510236222005915
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1223.3,
"completions/max_terminated_length": 905.9,
"completions/mean_length": 152.603515625,
"completions/mean_terminated_length": 146.7426330566406,
"completions/min_length": 68.3,
"completions/min_terminated_length": 68.3,
"entropy": 0.03903848642949015,
"epoch": 34.518201284796575,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.3881e-06,
"loss": -0.0064,
"num_tokens": 1571030154.0,
"reward": 1.0709179878234862,
"reward_std": 0.11353476271033287,
"rewards/reward_accuracy/mean": 0.97109375,
"rewards/reward_accuracy/std": 0.1125171072781086,
"rewards/reward_format/mean": 0.0998242199420929,
"rewards/reward_format/std": 0.0024446487659588456,
"sampling/importance_sampling_ratio/max": 2.520795500278473,
"sampling/importance_sampling_ratio/mean": 1.001498633623123,
"sampling/importance_sampling_ratio/min": 0.11508791008964181,
"sampling/sampling_logp_difference/max": 1.0005189776420593,
"sampling/sampling_logp_difference/mean": 0.003878114675171673,
"step": 16120,
"step_time": 6.078479649301153
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1148.4,
"completions/max_terminated_length": 918.2,
"completions/mean_length": 144.09375,
"completions/mean_terminated_length": 141.8668655395508,
"completions/min_length": 61.1,
"completions/min_terminated_length": 61.1,
"entropy": 0.031353766191750766,
"epoch": 34.53961456102784,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.32421875,
"learning_rate": 8.3871e-06,
"loss": 0.0001,
"num_tokens": 1571915386.0,
"reward": 1.068261730670929,
"reward_std": 0.13128048926591873,
"rewards/reward_accuracy/mean": 0.968359375,
"rewards/reward_accuracy/std": 0.13011004850268365,
"rewards/reward_format/mean": 0.09990234449505805,
"rewards/reward_format/std": 0.001562500116415322,
"sampling/importance_sampling_ratio/max": 2.4427770256996153,
"sampling/importance_sampling_ratio/mean": 0.9921477437019348,
"sampling/importance_sampling_ratio/min": 0.2079671561717987,
"sampling/sampling_logp_difference/max": 0.9780412673950195,
"sampling/sampling_logp_difference/mean": 0.0034702308708801865,
"step": 16130,
"step_time": 5.558735778517439
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1689.5,
"completions/max_terminated_length": 1329.8,
"completions/mean_length": 164.98671875,
"completions/mean_terminated_length": 159.81641693115233,
"completions/min_length": 70.3,
"completions/min_terminated_length": 70.3,
"entropy": 0.04147521608974784,
"epoch": 34.561027837259104,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.35546875,
"learning_rate": 8.386100000000001e-06,
"loss": -0.0061,
"num_tokens": 1572858024.0,
"reward": 1.0823046922683717,
"reward_std": 0.0984107281314209,
"rewards/reward_accuracy/mean": 0.982421875,
"rewards/reward_accuracy/std": 0.0971443235874176,
"rewards/reward_format/mean": 0.09988281279802322,
"rewards/reward_format/std": 0.0018750001210719347,
"sampling/importance_sampling_ratio/max": 2.4702561855316163,
"sampling/importance_sampling_ratio/mean": 0.9917015671730042,
"sampling/importance_sampling_ratio/min": 0.094052042812109,
"sampling/sampling_logp_difference/max": 0.8886285960674286,
"sampling/sampling_logp_difference/mean": 0.004082248732447624,
"step": 16140,
"step_time": 7.868237209683866
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 828.1,
"completions/max_terminated_length": 647.5,
"completions/mean_length": 146.1390625,
"completions/mean_terminated_length": 143.93939056396485,
"completions/min_length": 62.7,
"completions/min_terminated_length": 62.7,
"entropy": 0.03477447293698788,
"epoch": 34.58244111349036,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.3851e-06,
"loss": -0.0001,
"num_tokens": 1573748940.0,
"reward": 1.077734398841858,
"reward_std": 0.11262267529964447,
"rewards/reward_accuracy/mean": 0.977734375,
"rewards/reward_accuracy/std": 0.11262268126010895,
"rewards/reward_format/mean": 0.10000000149011612,
"rewards/reward_format/std": 0.0,
"sampling/importance_sampling_ratio/max": 2.436219048500061,
"sampling/importance_sampling_ratio/mean": 0.9977411985397339,
"sampling/importance_sampling_ratio/min": 0.2152244232594967,
"sampling/sampling_logp_difference/max": 1.024137806892395,
"sampling/sampling_logp_difference/mean": 0.0038026205962523817,
"step": 16150,
"step_time": 4.360732601804193
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1387.5,
"completions/max_terminated_length": 1095.6,
"completions/mean_length": 160.81953125,
"completions/mean_terminated_length": 147.70826568603516,
"completions/min_length": 66.3,
"completions/min_terminated_length": 66.3,
"entropy": 0.039138489542528986,
"epoch": 34.603854389721626,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.3841e-06,
"loss": 0.0034,
"num_tokens": 1574675678.0,
"reward": 1.059765636920929,
"reward_std": 0.13200943246483804,
"rewards/reward_accuracy/mean": 0.96015625,
"rewards/reward_accuracy/std": 0.13057657033205033,
"rewards/reward_format/mean": 0.099609375,
"rewards/reward_format/std": 0.003883264516480267,
"sampling/importance_sampling_ratio/max": 2.3782747626304626,
"sampling/importance_sampling_ratio/mean": 0.9809553802013398,
"sampling/importance_sampling_ratio/min": 0.20127590447664262,
"sampling/sampling_logp_difference/max": 1.1023305654525757,
"sampling/sampling_logp_difference/mean": 0.0039325022837147115,
"step": 16160,
"step_time": 6.99780238509411
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1435.3,
"completions/max_terminated_length": 1103.1,
"completions/mean_length": 156.116796875,
"completions/mean_terminated_length": 150.24732666015626,
"completions/min_length": 65.7,
"completions/min_terminated_length": 65.7,
"entropy": 0.041363912634551525,
"epoch": 34.62526766595289,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.055419921875,
"learning_rate": 8.383100000000001e-06,
"loss": -0.0088,
"num_tokens": 1575600473.0,
"reward": 1.0646679878234864,
"reward_std": 0.13151676387060435,
"rewards/reward_accuracy/mean": 0.96484375,
"rewards/reward_accuracy/std": 0.1304824061691761,
"rewards/reward_format/mean": 0.09982421919703484,
"rewards/reward_format/std": 0.0023328486597165464,
"sampling/importance_sampling_ratio/max": 2.5352561473846436,
"sampling/importance_sampling_ratio/mean": 0.9828745603561402,
"sampling/importance_sampling_ratio/min": 0.1053616687655449,
"sampling/sampling_logp_difference/max": 1.0266971111297607,
"sampling/sampling_logp_difference/mean": 0.004217135114595294,
"step": 16170,
"step_time": 6.659066395199625
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 979.4,
"completions/max_terminated_length": 947.0,
"completions/mean_length": 137.157421875,
"completions/mean_terminated_length": 136.41519317626953,
"completions/min_length": 60.9,
"completions/min_terminated_length": 60.9,
"entropy": 0.03135124382097274,
"epoch": 34.646680942184155,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.0,
"learning_rate": 8.3821e-06,
"loss": -0.0001,
"num_tokens": 1576462828.0,
"reward": 1.0882422089576722,
"reward_std": 0.0682930514216423,
"rewards/reward_accuracy/mean": 0.98828125,
"rewards/reward_accuracy/std": 0.0679219052195549,
"rewards/reward_format/mean": 0.0999609388411045,
"rewards/reward_format/std": 0.0006250000558793544,
"sampling/importance_sampling_ratio/max": 2.371667981147766,
"sampling/importance_sampling_ratio/mean": 0.9965525805950165,
"sampling/importance_sampling_ratio/min": 0.14407505355775357,
"sampling/sampling_logp_difference/max": 1.0206782579421998,
"sampling/sampling_logp_difference/mean": 0.0034222114831209184,
"step": 16180,
"step_time": 4.823656827487866
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 971.9,
"completions/max_terminated_length": 709.5,
"completions/mean_length": 144.813671875,
"completions/mean_terminated_length": 142.58446807861327,
"completions/min_length": 72.8,
"completions/min_terminated_length": 72.8,
"entropy": 0.0318797213723883,
"epoch": 34.66809421841542,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.45703125,
"learning_rate": 8.3811e-06,
"loss": -0.0072,
"num_tokens": 1577361039.0,
"reward": 1.0827343940734864,
"reward_std": 0.08560404032468796,
"rewards/reward_accuracy/mean": 0.9828125,
"rewards/reward_accuracy/std": 0.084527388215065,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.0012500001117587089,
"sampling/importance_sampling_ratio/max": 2.4891577482223513,
"sampling/importance_sampling_ratio/mean": 0.9984724223613739,
"sampling/importance_sampling_ratio/min": 0.12112211659550667,
"sampling/sampling_logp_difference/max": 1.060994517803192,
"sampling/sampling_logp_difference/mean": 0.0035495788557454943,
"step": 16190,
"step_time": 4.896263291110517
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1403.0,
"completions/max_terminated_length": 1109.2,
"completions/mean_length": 153.744921875,
"completions/mean_terminated_length": 147.12099914550782,
"completions/min_length": 61.4,
"completions/min_terminated_length": 61.4,
"entropy": 0.03687986861914396,
"epoch": 34.68950749464668,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.76953125,
"learning_rate": 8.380100000000001e-06,
"loss": 0.0003,
"num_tokens": 1578269394.0,
"reward": 1.0618554949760437,
"reward_std": 0.16003920659422874,
"rewards/reward_accuracy/mean": 0.962109375,
"rewards/reward_accuracy/std": 0.15893106088042258,
"rewards/reward_format/mean": 0.09974609538912774,
"rewards/reward_format/std": 0.003066375106573105,
"sampling/importance_sampling_ratio/max": 2.5015659093856812,
"sampling/importance_sampling_ratio/mean": 0.990731006860733,
"sampling/importance_sampling_ratio/min": 0.0945808332413435,
"sampling/sampling_logp_difference/max": 1.0117966830730438,
"sampling/sampling_logp_difference/mean": 0.003918366273865104,
"step": 16200,
"step_time": 6.840679686088697
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1307.4,
"completions/max_terminated_length": 948.2,
"completions/mean_length": 148.183203125,
"completions/mean_terminated_length": 145.2396469116211,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.03459032629616558,
"epoch": 34.71092077087795,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.08251953125,
"learning_rate": 8.3791e-06,
"loss": -0.0049,
"num_tokens": 1579167831.0,
"reward": 1.0771875143051148,
"reward_std": 0.09263129159808159,
"rewards/reward_accuracy/mean": 0.97734375,
"rewards/reward_accuracy/std": 0.09159038364887237,
"rewards/reward_format/mean": 0.09984375089406967,
"rewards/reward_format/std": 0.002012960007414222,
"sampling/importance_sampling_ratio/max": 2.3897481322288514,
"sampling/importance_sampling_ratio/mean": 0.9907686710357666,
"sampling/importance_sampling_ratio/min": 0.1186544917523861,
"sampling/sampling_logp_difference/max": 0.9341445207595825,
"sampling/sampling_logp_difference/mean": 0.003665625746361911,
"step": 16210,
"step_time": 6.22290601390705
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1461.4,
"completions/max_terminated_length": 1348.0,
"completions/mean_length": 157.4875,
"completions/mean_terminated_length": 152.42548217773438,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.044435213203541934,
"epoch": 34.732334047109205,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.296875,
"learning_rate": 8.378100000000002e-06,
"loss": -0.0079,
"num_tokens": 1580085543.0,
"reward": 1.0582422137260437,
"reward_std": 0.15208273380994797,
"rewards/reward_accuracy/mean": 0.95859375,
"rewards/reward_accuracy/std": 0.1507108822464943,
"rewards/reward_format/mean": 0.09964843913912773,
"rewards/reward_format/std": 0.0032062520505860446,
"sampling/importance_sampling_ratio/max": 2.5460832118988037,
"sampling/importance_sampling_ratio/mean": 0.98326855301857,
"sampling/importance_sampling_ratio/min": 0.08712842762470245,
"sampling/sampling_logp_difference/max": 1.035909104347229,
"sampling/sampling_logp_difference/mean": 0.004118877137079835,
"step": 16220,
"step_time": 7.01044895669038
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1116.4,
"completions/max_terminated_length": 911.9,
"completions/mean_length": 151.93046875,
"completions/mean_terminated_length": 148.29268493652344,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"entropy": 0.03581153911072761,
"epoch": 34.75374732334047,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.1630859375,
"learning_rate": 8.3771e-06,
"loss": 0.0023,
"num_tokens": 1580989077.0,
"reward": 1.0872851729393005,
"reward_std": 0.0735779769718647,
"rewards/reward_accuracy/mean": 0.9875,
"rewards/reward_accuracy/std": 0.07235103026032448,
"rewards/reward_format/mean": 0.09978515729308128,
"rewards/reward_format/std": 0.0023058353923261165,
"sampling/importance_sampling_ratio/max": 2.43031964302063,
"sampling/importance_sampling_ratio/mean": 0.989349091053009,
"sampling/importance_sampling_ratio/min": 0.20534395053982735,
"sampling/sampling_logp_difference/max": 1.0602524399757385,
"sampling/sampling_logp_difference/mean": 0.0034410898806527257,
"step": 16230,
"step_time": 5.452480874891625
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 940.8,
"completions/max_terminated_length": 887.3,
"completions/mean_length": 148.775,
"completions/mean_terminated_length": 146.60663299560548,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.03640007800422609,
"epoch": 34.775160599571734,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.279296875,
"learning_rate": 8.376100000000001e-06,
"loss": -0.0023,
"num_tokens": 1581889685.0,
"reward": 1.0693945407867431,
"reward_std": 0.14651307314634324,
"rewards/reward_accuracy/mean": 0.96953125,
"rewards/reward_accuracy/std": 0.14598962515592576,
"rewards/reward_format/mean": 0.09986328184604645,
"rewards/reward_format/std": 0.001390778203494847,
"sampling/importance_sampling_ratio/max": 2.5824660301208495,
"sampling/importance_sampling_ratio/mean": 0.9844608545303345,
"sampling/importance_sampling_ratio/min": 0.1368772342801094,
"sampling/sampling_logp_difference/max": 1.0594785928726196,
"sampling/sampling_logp_difference/mean": 0.00377996782772243,
"step": 16240,
"step_time": 4.791745817489573
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 952.7,
"completions/max_terminated_length": 815.2,
"completions/mean_length": 150.466796875,
"completions/mean_terminated_length": 144.56346130371094,
"completions/min_length": 67.9,
"completions/min_terminated_length": 67.9,
"entropy": 0.035223373654298486,
"epoch": 34.796573875803,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.150390625,
"learning_rate": 8.3751e-06,
"loss": -0.0058,
"num_tokens": 1582793680.0,
"reward": 1.0736523509025573,
"reward_std": 0.12041371539235116,
"rewards/reward_accuracy/mean": 0.973828125,
"rewards/reward_accuracy/std": 0.11959226876497268,
"rewards/reward_format/mean": 0.09982421919703484,
"rewards/reward_format/std": 0.0018318525282666088,
"sampling/importance_sampling_ratio/max": 2.524690103530884,
"sampling/importance_sampling_ratio/mean": 0.9929101228713989,
"sampling/importance_sampling_ratio/min": 0.11289390027523041,
"sampling/sampling_logp_difference/max": 0.9943876385688781,
"sampling/sampling_logp_difference/mean": 0.0036731277825310825,
"step": 16250,
"step_time": 4.831072928811773
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1200.8,
"completions/max_terminated_length": 896.6,
"completions/mean_length": 149.980078125,
"completions/mean_terminated_length": 144.06327362060546,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.034982691635377705,
"epoch": 34.81798715203426,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.3671875,
"learning_rate": 8.3741e-06,
"loss": -0.0022,
"num_tokens": 1583696333.0,
"reward": 1.0520703196525574,
"reward_std": 0.1832004100084305,
"rewards/reward_accuracy/mean": 0.95234375,
"rewards/reward_accuracy/std": 0.1816438615322113,
"rewards/reward_format/mean": 0.09972656294703483,
"rewards/reward_format/std": 0.003578278422355652,
"sampling/importance_sampling_ratio/max": 2.4579793095588682,
"sampling/importance_sampling_ratio/mean": 0.9942555367946625,
"sampling/importance_sampling_ratio/min": 0.18828665912151338,
"sampling/sampling_logp_difference/max": 1.0847427248954773,
"sampling/sampling_logp_difference/mean": 0.003805356053635478,
"step": 16260,
"step_time": 5.885165042188601
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1251.3,
"completions/max_terminated_length": 1209.3,
"completions/mean_length": 170.20234375,
"completions/mean_terminated_length": 154.31216125488282,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.045384189765900376,
"epoch": 34.83940042826553,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.435546875,
"learning_rate": 8.373100000000001e-06,
"loss": -0.0112,
"num_tokens": 1584652851.0,
"reward": 1.0624804973602295,
"reward_std": 0.14353215843439102,
"rewards/reward_accuracy/mean": 0.962890625,
"rewards/reward_accuracy/std": 0.14229123443365096,
"rewards/reward_format/mean": 0.09958984553813935,
"rewards/reward_format/std": 0.0036798993358388545,
"sampling/importance_sampling_ratio/max": 2.556861925125122,
"sampling/importance_sampling_ratio/mean": 0.9886037468910217,
"sampling/importance_sampling_ratio/min": 0.15609304010868072,
"sampling/sampling_logp_difference/max": 1.02576642036438,
"sampling/sampling_logp_difference/mean": 0.0038447306025773285,
"step": 16270,
"step_time": 6.6337654436094455
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1603.3,
"completions/max_terminated_length": 1463.5,
"completions/mean_length": 180.913671875,
"completions/mean_terminated_length": 161.971280670166,
"completions/min_length": 67.1,
"completions/min_terminated_length": 67.1,
"entropy": 0.0487758633447811,
"epoch": 34.860813704496785,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.3203125,
"learning_rate": 8.3721e-06,
"loss": -0.0073,
"num_tokens": 1585626310.0,
"reward": 1.0224804878234863,
"reward_std": 0.22829827219247817,
"rewards/reward_accuracy/mean": 0.9234375,
"rewards/reward_accuracy/std": 0.22464136257767678,
"rewards/reward_format/mean": 0.09904296919703484,
"rewards/reward_format/std": 0.006581835588440299,
"sampling/importance_sampling_ratio/max": 2.4334858536720274,
"sampling/importance_sampling_ratio/mean": 0.9655642509460449,
"sampling/importance_sampling_ratio/min": 0.06329292804002762,
"sampling/sampling_logp_difference/max": 1.0451550841331483,
"sampling/sampling_logp_difference/mean": 0.004161730082705617,
"step": 16280,
"step_time": 8.01594822050538
},
{
"clip_ratio/high_max": 1.4817448391113431e-05,
"clip_ratio/high_mean": 1.8521810488891789e-06,
"clip_ratio/low_mean": 3.7026065911049957e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.2224417079996783e-06,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1503.8,
"completions/max_terminated_length": 1411.7,
"completions/mean_length": 185.20859375,
"completions/mean_terminated_length": 172.30386199951172,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.0480262111639604,
"epoch": 34.88222698072805,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.263671875,
"learning_rate": 8.3711e-06,
"loss": -0.0083,
"num_tokens": 1586621436.0,
"reward": 1.0579492449760437,
"reward_std": 0.1556005895137787,
"rewards/reward_accuracy/mean": 0.95859375,
"rewards/reward_accuracy/std": 0.15272591263055801,
"rewards/reward_format/mean": 0.09935547038912773,
"rewards/reward_format/std": 0.005001882649958133,
"sampling/importance_sampling_ratio/max": 2.534791946411133,
"sampling/importance_sampling_ratio/mean": 0.9748587965965271,
"sampling/importance_sampling_ratio/min": 0.054264617571607235,
"sampling/sampling_logp_difference/max": 1.4872349977493287,
"sampling/sampling_logp_difference/mean": 0.004074881458655,
"step": 16290,
"step_time": 7.481275591897429
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1227.0,
"completions/max_terminated_length": 1205.1,
"completions/mean_length": 140.83125,
"completions/mean_terminated_length": 138.6354537963867,
"completions/min_length": 61.8,
"completions/min_terminated_length": 61.8,
"entropy": 0.03589235064573586,
"epoch": 34.903640256959314,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.370100000000001e-06,
"loss": 0.0005,
"num_tokens": 1587496812.0,
"reward": 1.0783593773841857,
"reward_std": 0.11281695142388344,
"rewards/reward_accuracy/mean": 0.978515625,
"rewards/reward_accuracy/std": 0.11191032454371452,
"rewards/reward_format/mean": 0.09984375014901162,
"rewards/reward_format/std": 0.001703278301283717,
"sampling/importance_sampling_ratio/max": 2.504762887954712,
"sampling/importance_sampling_ratio/mean": 0.9997106790542603,
"sampling/importance_sampling_ratio/min": 0.15920191034674644,
"sampling/sampling_logp_difference/max": 1.2805246710777283,
"sampling/sampling_logp_difference/mean": 0.003797920816577971,
"step": 16300,
"step_time": 5.851558383414522
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1247.5,
"completions/max_terminated_length": 1076.2,
"completions/mean_length": 141.742578125,
"completions/mean_terminated_length": 140.27479248046876,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.03628264362923801,
"epoch": 34.92505353319058,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.369100000000001e-06,
"loss": -0.0024,
"num_tokens": 1588375241.0,
"reward": 1.0748828053474426,
"reward_std": 0.13340726867318153,
"rewards/reward_accuracy/mean": 0.975,
"rewards/reward_accuracy/std": 0.13228895291686057,
"rewards/reward_format/mean": 0.09988281205296516,
"rewards/reward_format/std": 0.001875000074505806,
"sampling/importance_sampling_ratio/max": 2.585959529876709,
"sampling/importance_sampling_ratio/mean": 0.9938423275947571,
"sampling/importance_sampling_ratio/min": 0.051136910915374756,
"sampling/sampling_logp_difference/max": 0.9897579431533814,
"sampling/sampling_logp_difference/mean": 0.004037484293803573,
"step": 16310,
"step_time": 6.03739411389397
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1317.5,
"completions/max_terminated_length": 964.6,
"completions/mean_length": 149.70234375,
"completions/mean_terminated_length": 141.4780418395996,
"completions/min_length": 68.2,
"completions/min_terminated_length": 68.2,
"entropy": 0.035899090277962384,
"epoch": 34.94646680942184,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.255859375,
"learning_rate": 8.3681e-06,
"loss": -0.002,
"num_tokens": 1589276287.0,
"reward": 1.0868359684944153,
"reward_std": 0.08716326504945755,
"rewards/reward_accuracy/mean": 0.987109375,
"rewards/reward_accuracy/std": 0.08595144897699356,
"rewards/reward_format/mean": 0.09972656443715096,
"rewards/reward_format/std": 0.001634024828672409,
"sampling/importance_sampling_ratio/max": 2.406379425525665,
"sampling/importance_sampling_ratio/mean": 0.9952878534793854,
"sampling/importance_sampling_ratio/min": 0.21105334744788706,
"sampling/sampling_logp_difference/max": 0.8688412427902221,
"sampling/sampling_logp_difference/mean": 0.003868978680111468,
"step": 16320,
"step_time": 6.376809852194856
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1131.3,
"completions/max_terminated_length": 780.1,
"completions/mean_length": 151.816796875,
"completions/mean_terminated_length": 145.23536682128906,
"completions/min_length": 68.5,
"completions/min_terminated_length": 68.5,
"entropy": 0.03813749635592103,
"epoch": 34.96788008565311,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.3671e-06,
"loss": -0.005,
"num_tokens": 1590180522.0,
"reward": 1.0806640803813934,
"reward_std": 0.0895628109574318,
"rewards/reward_accuracy/mean": 0.980859375,
"rewards/reward_accuracy/std": 0.08895176872611046,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.0019604268483817576,
"sampling/importance_sampling_ratio/max": 2.524397373199463,
"sampling/importance_sampling_ratio/mean": 0.9954328835010529,
"sampling/importance_sampling_ratio/min": 0.09919506199657917,
"sampling/sampling_logp_difference/max": 1.159006690979004,
"sampling/sampling_logp_difference/mean": 0.0039750771597027775,
"step": 16330,
"step_time": 5.535777788978885
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1434.1,
"completions/max_terminated_length": 1227.9,
"completions/mean_length": 146.57734375,
"completions/mean_terminated_length": 144.3603614807129,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.038061954104341565,
"epoch": 34.98929336188437,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.49609375,
"learning_rate": 8.366100000000001e-06,
"loss": -0.0056,
"num_tokens": 1591073424.0,
"reward": 1.0564843893051148,
"reward_std": 0.16630405113101004,
"rewards/reward_accuracy/mean": 0.956640625,
"rewards/reward_accuracy/std": 0.16571741178631783,
"rewards/reward_format/mean": 0.09984375089406967,
"rewards/reward_format/std": 0.002260174439288676,
"sampling/importance_sampling_ratio/max": 2.287727880477905,
"sampling/importance_sampling_ratio/mean": 0.9941800713539124,
"sampling/importance_sampling_ratio/min": 0.18136740960180758,
"sampling/sampling_logp_difference/max": 0.9508365035057068,
"sampling/sampling_logp_difference/mean": 0.003929645963944494,
"step": 16340,
"step_time": 6.688410925903009
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1395.4,
"completions/max_terminated_length": 1305.4,
"completions/mean_length": 194.9578125,
"completions/mean_terminated_length": 177.75242767333984,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.05372921726666391,
"epoch": 35.01070663811563,
"frac_reward_zero_std": 0.8625,
"grad_norm": 0.291015625,
"learning_rate": 8.3651e-06,
"loss": -0.01,
"num_tokens": 1592101988.0,
"reward": 1.0589453339576722,
"reward_std": 0.15466150417923927,
"rewards/reward_accuracy/mean": 0.959375,
"rewards/reward_accuracy/std": 0.15310990884900094,
"rewards/reward_format/mean": 0.09957031384110451,
"rewards/reward_format/std": 0.004183325078338384,
"sampling/importance_sampling_ratio/max": 2.542636585235596,
"sampling/importance_sampling_ratio/mean": 0.978504192829132,
"sampling/importance_sampling_ratio/min": 0.08775998800992965,
"sampling/sampling_logp_difference/max": 1.003212809562683,
"sampling/sampling_logp_difference/mean": 0.004433482280001044,
"step": 16350,
"step_time": 7.171096612606197
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1292.8,
"completions/max_terminated_length": 1239.0,
"completions/mean_length": 176.526171875,
"completions/mean_terminated_length": 166.36797790527345,
"completions/min_length": 66.4,
"completions/min_terminated_length": 66.4,
"entropy": 0.04133268331643194,
"epoch": 35.03211991434689,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.26171875,
"learning_rate": 8.3641e-06,
"loss": -0.0002,
"num_tokens": 1593079159.0,
"reward": 1.0673828125,
"reward_std": 0.1439361646771431,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.14150649607181548,
"rewards/reward_format/mean": 0.0994140625,
"rewards/reward_format/std": 0.00474475531373173,
"sampling/importance_sampling_ratio/max": 2.5475902795791625,
"sampling/importance_sampling_ratio/mean": 0.9860001921653747,
"sampling/importance_sampling_ratio/min": 0.18337934762239455,
"sampling/sampling_logp_difference/max": 0.9659007012844085,
"sampling/sampling_logp_difference/mean": 0.0037820600904524327,
"step": 16360,
"step_time": 6.786608235092717
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1605.1,
"completions/max_terminated_length": 1248.7,
"completions/mean_length": 166.92734375,
"completions/mean_terminated_length": 156.69214782714843,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.040784524637274444,
"epoch": 35.05353319057816,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.62109375,
"learning_rate": 8.363100000000001e-06,
"loss": -0.0051,
"num_tokens": 1594033661.0,
"reward": 1.0535547137260437,
"reward_std": 0.17382264211773873,
"rewards/reward_accuracy/mean": 0.95390625,
"rewards/reward_accuracy/std": 0.17196570858359336,
"rewards/reward_format/mean": 0.09964843839406967,
"rewards/reward_format/std": 0.003518686816096306,
"sampling/importance_sampling_ratio/max": 2.636326026916504,
"sampling/importance_sampling_ratio/mean": 0.993579775094986,
"sampling/importance_sampling_ratio/min": 0.10119160860776902,
"sampling/sampling_logp_difference/max": 1.2465099930763244,
"sampling/sampling_logp_difference/mean": 0.004045495297759771,
"step": 16370,
"step_time": 7.845758598699467
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1206.3,
"completions/max_terminated_length": 1141.8,
"completions/mean_length": 162.984765625,
"completions/mean_terminated_length": 152.86957702636718,
"completions/min_length": 61.3,
"completions/min_terminated_length": 61.3,
"entropy": 0.04937058144714683,
"epoch": 35.07494646680942,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.3621e-06,
"loss": 0.0,
"num_tokens": 1594965494.0,
"reward": 1.063281273841858,
"reward_std": 0.1480856567621231,
"rewards/reward_accuracy/mean": 0.963671875,
"rewards/reward_accuracy/std": 0.14671168476343155,
"rewards/reward_format/mean": 0.09960937649011611,
"rewards/reward_format/std": 0.0029830871149897575,
"sampling/importance_sampling_ratio/max": 2.5466134786605834,
"sampling/importance_sampling_ratio/mean": 0.988847428560257,
"sampling/importance_sampling_ratio/min": 0.048608634946867825,
"sampling/sampling_logp_difference/max": 1.0276130199432374,
"sampling/sampling_logp_difference/mean": 0.004538927529938519,
"step": 16380,
"step_time": 5.97760852179781
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 933.2,
"completions/max_terminated_length": 726.6,
"completions/mean_length": 144.153125,
"completions/mean_terminated_length": 141.19934997558593,
"completions/min_length": 67.3,
"completions/min_terminated_length": 67.3,
"entropy": 0.03452780083753169,
"epoch": 35.096359743040686,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.0,
"learning_rate": 8.3611e-06,
"loss": -0.0041,
"num_tokens": 1595855486.0,
"reward": 1.0776562690734863,
"reward_std": 0.09627666473388671,
"rewards/reward_accuracy/mean": 0.977734375,
"rewards/reward_accuracy/std": 0.09551033228635789,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.0012500001117587089,
"sampling/importance_sampling_ratio/max": 2.4155043601989745,
"sampling/importance_sampling_ratio/mean": 0.9949823439121246,
"sampling/importance_sampling_ratio/min": 0.22564642280340194,
"sampling/sampling_logp_difference/max": 1.042791873216629,
"sampling/sampling_logp_difference/mean": 0.003809555433690548,
"step": 16390,
"step_time": 4.718263251308235
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1492.4,
"completions/max_terminated_length": 1194.8,
"completions/mean_length": 158.4796875,
"completions/mean_terminated_length": 150.42829284667968,
"completions/min_length": 65.2,
"completions/min_terminated_length": 65.2,
"entropy": 0.04119498922955245,
"epoch": 35.11777301927195,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.1875,
"learning_rate": 8.360100000000001e-06,
"loss": -0.008,
"num_tokens": 1596781210.0,
"reward": 1.0706445693969726,
"reward_std": 0.12649078220129012,
"rewards/reward_accuracy/mean": 0.97109375,
"rewards/reward_accuracy/std": 0.12421037554740906,
"rewards/reward_format/mean": 0.09955078214406968,
"rewards/reward_format/std": 0.004098456422798336,
"sampling/importance_sampling_ratio/max": 2.35240797996521,
"sampling/importance_sampling_ratio/mean": 0.9812588930130005,
"sampling/importance_sampling_ratio/min": 0.08623406197875738,
"sampling/sampling_logp_difference/max": 1.2497260689735412,
"sampling/sampling_logp_difference/mean": 0.004114431119523943,
"step": 16400,
"step_time": 7.031391149913543
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 861.1,
"completions/max_terminated_length": 727.0,
"completions/mean_length": 140.9421875,
"completions/mean_terminated_length": 138.71842346191406,
"completions/min_length": 62.8,
"completions/min_terminated_length": 62.8,
"entropy": 0.030545475310645998,
"epoch": 35.139186295503215,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.1513671875,
"learning_rate": 8.359100000000001e-06,
"loss": 0.0006,
"num_tokens": 1597660422.0,
"reward": 1.077246117591858,
"reward_std": 0.09529143497347832,
"rewards/reward_accuracy/mean": 0.97734375,
"rewards/reward_accuracy/std": 0.09459400624036789,
"rewards/reward_format/mean": 0.09990234524011612,
"rewards/reward_format/std": 0.001194648747332394,
"sampling/importance_sampling_ratio/max": 2.5917471170425417,
"sampling/importance_sampling_ratio/mean": 1.0037765502929688,
"sampling/importance_sampling_ratio/min": 0.10889315120875835,
"sampling/sampling_logp_difference/max": 1.1477653503417968,
"sampling/sampling_logp_difference/mean": 0.003437848319299519,
"step": 16410,
"step_time": 4.423172673702356
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1255.5,
"completions/max_terminated_length": 1055.1,
"completions/mean_length": 163.31484375,
"completions/mean_terminated_length": 155.3362609863281,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.04519235612824559,
"epoch": 35.16059957173447,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.3581e-06,
"loss": -0.0009,
"num_tokens": 1598602300.0,
"reward": 1.0711914420127868,
"reward_std": 0.12187819853425026,
"rewards/reward_accuracy/mean": 0.971484375,
"rewards/reward_accuracy/std": 0.12086264342069626,
"rewards/reward_format/mean": 0.09970703348517418,
"rewards/reward_format/std": 0.002624061331152916,
"sampling/importance_sampling_ratio/max": 2.4151984333992003,
"sampling/importance_sampling_ratio/mean": 0.9822398126125336,
"sampling/importance_sampling_ratio/min": 0.1634305713698268,
"sampling/sampling_logp_difference/max": 0.901533329486847,
"sampling/sampling_logp_difference/mean": 0.004124010377563536,
"step": 16420,
"step_time": 6.301085587320268
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 1.013923429127317e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 1.013923429127317e-06,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1265.2,
"completions/max_terminated_length": 1022.9,
"completions/mean_length": 160.129296875,
"completions/mean_terminated_length": 148.40702209472656,
"completions/min_length": 68.4,
"completions/min_terminated_length": 68.4,
"entropy": 0.04097858094610274,
"epoch": 35.18201284796574,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.2197265625,
"learning_rate": 8.3571e-06,
"loss": -0.0103,
"num_tokens": 1599529143.0,
"reward": 1.0460937678813935,
"reward_std": 0.17182331681251525,
"rewards/reward_accuracy/mean": 0.946484375,
"rewards/reward_accuracy/std": 0.1698422111570835,
"rewards/reward_format/mean": 0.09960937574505806,
"rewards/reward_format/std": 0.003660792508162558,
"sampling/importance_sampling_ratio/max": 2.4876076579093933,
"sampling/importance_sampling_ratio/mean": 0.984029746055603,
"sampling/importance_sampling_ratio/min": 0.0712982858531177,
"sampling/sampling_logp_difference/max": 1.0446358561515807,
"sampling/sampling_logp_difference/mean": 0.003901756880804896,
"step": 16430,
"step_time": 6.319243777220254
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1513.5,
"completions/max_terminated_length": 1147.6,
"completions/mean_length": 182.81640625,
"completions/mean_terminated_length": 171.1333435058594,
"completions/min_length": 67.8,
"completions/min_terminated_length": 67.8,
"entropy": 0.04506555870175362,
"epoch": 35.203426124197,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.1142578125,
"learning_rate": 8.3561e-06,
"loss": -0.0051,
"num_tokens": 1600524417.0,
"reward": 1.0559765815734863,
"reward_std": 0.18369959592819213,
"rewards/reward_accuracy/mean": 0.956640625,
"rewards/reward_accuracy/std": 0.18048669323325156,
"rewards/reward_format/mean": 0.0993359386920929,
"rewards/reward_format/std": 0.006366825569421053,
"sampling/importance_sampling_ratio/max": 2.4703575372695923,
"sampling/importance_sampling_ratio/mean": 0.986130690574646,
"sampling/importance_sampling_ratio/min": 0.11038573309779168,
"sampling/sampling_logp_difference/max": 1.0653946459293366,
"sampling/sampling_logp_difference/mean": 0.004110041726380587,
"step": 16440,
"step_time": 7.80973784699745
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1043.5,
"completions/max_terminated_length": 669.8,
"completions/mean_length": 141.368359375,
"completions/mean_terminated_length": 134.69865951538085,
"completions/min_length": 60.1,
"completions/min_terminated_length": 60.1,
"entropy": 0.032122283219359817,
"epoch": 35.224839400428266,
"frac_reward_zero_std": 0.96875,
"grad_norm": 0.1064453125,
"learning_rate": 8.3551e-06,
"loss": 0.0012,
"num_tokens": 1601404192.0,
"reward": 1.0868359684944153,
"reward_std": 0.07246346473693847,
"rewards/reward_accuracy/mean": 0.987109375,
"rewards/reward_accuracy/std": 0.07125164270401001,
"rewards/reward_format/mean": 0.09972656443715096,
"rewards/reward_format/std": 0.001634024828672409,
"sampling/importance_sampling_ratio/max": 2.2471796751022337,
"sampling/importance_sampling_ratio/mean": 0.991901558637619,
"sampling/importance_sampling_ratio/min": 0.22402238249778747,
"sampling/sampling_logp_difference/max": 1.038509601354599,
"sampling/sampling_logp_difference/mean": 0.003381925099529326,
"step": 16450,
"step_time": 5.172751429010532
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 913.3,
"completions/max_terminated_length": 710.4,
"completions/mean_length": 137.076953125,
"completions/mean_terminated_length": 135.58627014160157,
"completions/min_length": 70.4,
"completions/min_terminated_length": 70.4,
"entropy": 0.030743689578957855,
"epoch": 35.24625267665953,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.09912109375,
"learning_rate": 8.3541e-06,
"loss": 0.0011,
"num_tokens": 1602272853.0,
"reward": 1.0839257955551147,
"reward_std": 0.08395063802599907,
"rewards/reward_accuracy/mean": 0.983984375,
"rewards/reward_accuracy/std": 0.08326699137687683,
"rewards/reward_format/mean": 0.09994140714406967,
"rewards/reward_format/std": 0.0009375000605359674,
"sampling/importance_sampling_ratio/max": 2.3787636756896973,
"sampling/importance_sampling_ratio/mean": 0.9819418489933014,
"sampling/importance_sampling_ratio/min": 0.20682551115751266,
"sampling/sampling_logp_difference/max": 1.0382812738418579,
"sampling/sampling_logp_difference/mean": 0.0035749432630836965,
"step": 16460,
"step_time": 4.557439194095787
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1445.4,
"completions/max_terminated_length": 1113.6,
"completions/mean_length": 148.9390625,
"completions/mean_terminated_length": 144.4818084716797,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.036999257188290356,
"epoch": 35.267665952890795,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0,
"learning_rate": 8.353100000000001e-06,
"loss": -0.0033,
"num_tokens": 1603170873.0,
"reward": 1.070898461341858,
"reward_std": 0.11876859068870545,
"rewards/reward_accuracy/mean": 0.97109375,
"rewards/reward_accuracy/std": 0.11709796637296677,
"rewards/reward_format/mean": 0.09980468899011612,
"rewards/reward_format/std": 0.002637960109859705,
"sampling/importance_sampling_ratio/max": 2.3751661658287047,
"sampling/importance_sampling_ratio/mean": 0.9932693719863892,
"sampling/importance_sampling_ratio/min": 0.19719114513136446,
"sampling/sampling_logp_difference/max": 0.9387115716934205,
"sampling/sampling_logp_difference/mean": 0.0037201986648142337,
"step": 16470,
"step_time": 6.821153709487407
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1003.8,
"completions/max_terminated_length": 948.1,
"completions/mean_length": 151.57265625,
"completions/mean_terminated_length": 150.13954162597656,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.03393480263184756,
"epoch": 35.28907922912206,
"frac_reward_zero_std": 0.96875,
"grad_norm": 0.0,
"learning_rate": 8.352100000000001e-06,
"loss": -0.0026,
"num_tokens": 1604073075.0,
"reward": 1.068613302707672,
"reward_std": 0.14204713180661202,
"rewards/reward_accuracy/mean": 0.96875,
"rewards/reward_accuracy/std": 0.1413528300821781,
"rewards/reward_format/mean": 0.09986328259110451,
"rewards/reward_format/std": 0.0010294009000062943,
"sampling/importance_sampling_ratio/max": 2.3853408217430117,
"sampling/importance_sampling_ratio/mean": 0.9774781882762908,
"sampling/importance_sampling_ratio/min": 0.1098151035606861,
"sampling/sampling_logp_difference/max": 0.9509888172149659,
"sampling/sampling_logp_difference/mean": 0.003449137695133686,
"step": 16480,
"step_time": 4.9734724157926395
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1062.1,
"completions/max_terminated_length": 858.0,
"completions/mean_length": 149.566015625,
"completions/mean_terminated_length": 145.88533935546874,
"completions/min_length": 68.5,
"completions/min_terminated_length": 68.5,
"entropy": 0.03417244679294527,
"epoch": 35.31049250535332,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.0,
"learning_rate": 8.3511e-06,
"loss": -0.0022,
"num_tokens": 1604975468.0,
"reward": 1.079492199420929,
"reward_std": 0.11690697744488716,
"rewards/reward_accuracy/mean": 0.9796875,
"rewards/reward_accuracy/std": 0.11580003052949905,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.002385118161328137,
"sampling/importance_sampling_ratio/max": 2.4412363290786745,
"sampling/importance_sampling_ratio/mean": 0.9991845309734344,
"sampling/importance_sampling_ratio/min": 0.1150436144322157,
"sampling/sampling_logp_difference/max": 0.9291399002075196,
"sampling/sampling_logp_difference/mean": 0.003624389786273241,
"step": 16490,
"step_time": 5.230468075003591
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1123.5,
"completions/max_terminated_length": 980.7,
"completions/mean_length": 143.369140625,
"completions/mean_terminated_length": 138.198583984375,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.03540830726269632,
"epoch": 35.33190578158458,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.74609375,
"learning_rate": 8.350100000000002e-06,
"loss": -0.0004,
"num_tokens": 1605863357.0,
"reward": 1.0587500095367433,
"reward_std": 0.16537216156721116,
"rewards/reward_accuracy/mean": 0.958984375,
"rewards/reward_accuracy/std": 0.16434792429208755,
"rewards/reward_format/mean": 0.09976562559604644,
"rewards/reward_format/std": 0.0026831001276150348,
"sampling/importance_sampling_ratio/max": 2.4411667823791503,
"sampling/importance_sampling_ratio/mean": 0.9966308832168579,
"sampling/importance_sampling_ratio/min": 0.21330296993255615,
"sampling/sampling_logp_difference/max": 0.9323745727539062,
"sampling/sampling_logp_difference/mean": 0.003745483700186014,
"step": 16500,
"step_time": 5.6351087067014305
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1262.8,
"completions/max_terminated_length": 1027.7,
"completions/mean_length": 146.909375,
"completions/mean_terminated_length": 143.93991241455078,
"completions/min_length": 69.4,
"completions/min_terminated_length": 69.4,
"entropy": 0.03572028772905469,
"epoch": 35.353319057815845,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.095703125,
"learning_rate": 8.349100000000001e-06,
"loss": -0.0058,
"num_tokens": 1606763317.0,
"reward": 1.0760351777076722,
"reward_std": 0.12049658000469207,
"rewards/reward_accuracy/mean": 0.976171875,
"rewards/reward_accuracy/std": 0.11944534182548523,
"rewards/reward_format/mean": 0.09986328259110451,
"rewards/reward_format/std": 0.0018196487100794912,
"sampling/importance_sampling_ratio/max": 2.4168314814567564,
"sampling/importance_sampling_ratio/mean": 0.9826640844345093,
"sampling/importance_sampling_ratio/min": 0.15013345554471016,
"sampling/sampling_logp_difference/max": 1.0765088319778442,
"sampling/sampling_logp_difference/mean": 0.0038414848502725365,
"step": 16510,
"step_time": 5.954188217318733
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 909.0,
"completions/max_terminated_length": 813.5,
"completions/mean_length": 145.427734375,
"completions/mean_terminated_length": 143.22134704589843,
"completions/min_length": 63.2,
"completions/min_terminated_length": 63.2,
"entropy": 0.03504897418897599,
"epoch": 35.37473233404711,
"frac_reward_zero_std": 0.96875,
"grad_norm": 0.0,
"learning_rate": 8.3481e-06,
"loss": 0.0005,
"num_tokens": 1607655260.0,
"reward": 1.0819726824760436,
"reward_std": 0.08506778329610824,
"rewards/reward_accuracy/mean": 0.98203125,
"rewards/reward_accuracy/std": 0.08461260348558426,
"rewards/reward_format/mean": 0.09994140788912773,
"rewards/reward_format/std": 0.0006976742763072253,
"sampling/importance_sampling_ratio/max": 2.462025022506714,
"sampling/importance_sampling_ratio/mean": 0.9891530632972717,
"sampling/importance_sampling_ratio/min": 0.21832610815763473,
"sampling/sampling_logp_difference/max": 0.9006438314914703,
"sampling/sampling_logp_difference/mean": 0.0035551294218748807,
"step": 16520,
"step_time": 4.600197409500834
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1197.3,
"completions/max_terminated_length": 909.9,
"completions/mean_length": 145.999609375,
"completions/mean_terminated_length": 140.85174789428712,
"completions/min_length": 63.5,
"completions/min_terminated_length": 63.5,
"entropy": 0.03676970161031932,
"epoch": 35.396145610278374,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.0390625,
"learning_rate": 8.3471e-06,
"loss": -0.0023,
"num_tokens": 1608536235.0,
"reward": 1.0701171994209289,
"reward_std": 0.12901999801397324,
"rewards/reward_accuracy/mean": 0.9703125,
"rewards/reward_accuracy/std": 0.12804489433765412,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.002496726461686194,
"sampling/importance_sampling_ratio/max": 2.533514475822449,
"sampling/importance_sampling_ratio/mean": 0.994959682226181,
"sampling/importance_sampling_ratio/min": 0.07672785595059395,
"sampling/sampling_logp_difference/max": 1.1341453313827514,
"sampling/sampling_logp_difference/mean": 0.003833824652247131,
"step": 16530,
"step_time": 5.9897135965904456
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1341.5,
"completions/max_terminated_length": 1089.3,
"completions/mean_length": 152.12578125,
"completions/mean_terminated_length": 145.54142837524415,
"completions/min_length": 68.8,
"completions/min_terminated_length": 68.8,
"entropy": 0.03653988731093705,
"epoch": 35.41755888650964,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.3461e-06,
"loss": -0.0009,
"num_tokens": 1609441085.0,
"reward": 1.0696679830551148,
"reward_std": 0.11236065179109574,
"rewards/reward_accuracy/mean": 0.969921875,
"rewards/reward_accuracy/std": 0.11109263598918914,
"rewards/reward_format/mean": 0.09974609538912774,
"rewards/reward_format/std": 0.003194400784559548,
"sampling/importance_sampling_ratio/max": 2.5076547622680665,
"sampling/importance_sampling_ratio/mean": 0.988648521900177,
"sampling/importance_sampling_ratio/min": 0.08625393882393836,
"sampling/sampling_logp_difference/max": 1.18781476020813,
"sampling/sampling_logp_difference/mean": 0.003788560046814382,
"step": 16540,
"step_time": 6.524363787492621
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1372.5,
"completions/max_terminated_length": 1079.4,
"completions/mean_length": 157.02578125,
"completions/mean_terminated_length": 153.36053390502929,
"completions/min_length": 61.9,
"completions/min_terminated_length": 61.9,
"entropy": 0.04281559584196657,
"epoch": 35.438972162740896,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.3451e-06,
"loss": -0.0031,
"num_tokens": 1610357279.0,
"reward": 1.0728515625,
"reward_std": 0.1215345673263073,
"rewards/reward_accuracy/mean": 0.973046875,
"rewards/reward_accuracy/std": 0.12016557678580284,
"rewards/reward_format/mean": 0.0998046875,
"rewards/reward_format/std": 0.0024967264151200654,
"sampling/importance_sampling_ratio/max": 2.442826247215271,
"sampling/importance_sampling_ratio/mean": 0.9867194294929504,
"sampling/importance_sampling_ratio/min": 0.11743850186467171,
"sampling/sampling_logp_difference/max": 1.0022576928138733,
"sampling/sampling_logp_difference/mean": 0.004089093208312989,
"step": 16550,
"step_time": 6.753300376690459
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1290.1,
"completions/max_terminated_length": 1067.9,
"completions/mean_length": 165.748046875,
"completions/mean_terminated_length": 157.0276077270508,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.041407301812432705,
"epoch": 35.46038543897216,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.6171875,
"learning_rate": 8.3441e-06,
"loss": -0.0017,
"num_tokens": 1611300874.0,
"reward": 1.0639258027076721,
"reward_std": 0.16183795183897018,
"rewards/reward_accuracy/mean": 0.964453125,
"rewards/reward_accuracy/std": 0.1595488928258419,
"rewards/reward_format/mean": 0.09947265684604645,
"rewards/reward_format/std": 0.00424602038692683,
"sampling/importance_sampling_ratio/max": 2.5576024293899535,
"sampling/importance_sampling_ratio/mean": 0.9906827628612518,
"sampling/importance_sampling_ratio/min": 0.14517192989587785,
"sampling/sampling_logp_difference/max": 1.370765244960785,
"sampling/sampling_logp_difference/mean": 0.003911342192441225,
"step": 16560,
"step_time": 6.658677626596182
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1031.8,
"completions/max_terminated_length": 680.5,
"completions/mean_length": 145.8390625,
"completions/mean_terminated_length": 143.60008850097657,
"completions/min_length": 66.2,
"completions/min_terminated_length": 66.2,
"entropy": 0.032197213545441625,
"epoch": 35.481798715203425,
"frac_reward_zero_std": 0.96875,
"grad_norm": 0.0,
"learning_rate": 8.343100000000001e-06,
"loss": -0.0044,
"num_tokens": 1612190366.0,
"reward": 1.054550790786743,
"reward_std": 0.16532655656337739,
"rewards/reward_accuracy/mean": 0.9546875,
"rewards/reward_accuracy/std": 0.1646145798265934,
"rewards/reward_format/mean": 0.09986328184604645,
"rewards/reward_format/std": 0.002187500172294676,
"sampling/importance_sampling_ratio/max": 2.4372332096099854,
"sampling/importance_sampling_ratio/mean": 0.9890428900718689,
"sampling/importance_sampling_ratio/min": 0.11845102589577436,
"sampling/sampling_logp_difference/max": 0.9999740719795227,
"sampling/sampling_logp_difference/mean": 0.0035119397100061176,
"step": 16570,
"step_time": 4.9284031931078065
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1083.7,
"completions/max_terminated_length": 847.2,
"completions/mean_length": 151.290625,
"completions/mean_terminated_length": 143.19916839599608,
"completions/min_length": 62.0,
"completions/min_terminated_length": 62.0,
"entropy": 0.035939648654311894,
"epoch": 35.50321199143469,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.2109375,
"learning_rate": 8.342100000000001e-06,
"loss": 0.0016,
"num_tokens": 1613093158.0,
"reward": 1.0738867282867433,
"reward_std": 0.11746819615364075,
"rewards/reward_accuracy/mean": 0.97421875,
"rewards/reward_accuracy/std": 0.11618792340159416,
"rewards/reward_format/mean": 0.09966796934604645,
"rewards/reward_format/std": 0.0030783477472141386,
"sampling/importance_sampling_ratio/max": 2.385914182662964,
"sampling/importance_sampling_ratio/mean": 0.9847397923469543,
"sampling/importance_sampling_ratio/min": 0.07037175986915827,
"sampling/sampling_logp_difference/max": 1.2038981199264527,
"sampling/sampling_logp_difference/mean": 0.003941973857581616,
"step": 16580,
"step_time": 5.596604048996232
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 790.4,
"completions/max_terminated_length": 686.8,
"completions/mean_length": 142.887890625,
"completions/mean_terminated_length": 140.67857360839844,
"completions/min_length": 64.7,
"completions/min_terminated_length": 64.7,
"entropy": 0.03134152616839856,
"epoch": 35.524625267665954,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.068359375,
"learning_rate": 8.3411e-06,
"loss": -0.0062,
"num_tokens": 1613971431.0,
"reward": 1.0721484661102294,
"reward_std": 0.10304519981145858,
"rewards/reward_accuracy/mean": 0.972265625,
"rewards/reward_accuracy/std": 0.10245348364114762,
"rewards/reward_format/mean": 0.09988281428813935,
"rewards/reward_format/std": 0.001387959998100996,
"sampling/importance_sampling_ratio/max": 2.4199413895606994,
"sampling/importance_sampling_ratio/mean": 0.9857752680778503,
"sampling/importance_sampling_ratio/min": 0.17312203329056502,
"sampling/sampling_logp_difference/max": 0.9709123790264129,
"sampling/sampling_logp_difference/mean": 0.003464928641915321,
"step": 16590,
"step_time": 4.434072761601419
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1806.9,
"completions/max_terminated_length": 1472.4,
"completions/mean_length": 177.99765625,
"completions/mean_terminated_length": 161.86730346679687,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.049379786988720295,
"epoch": 35.54603854389722,
"frac_reward_zero_std": 0.8875,
"grad_norm": 0.353515625,
"learning_rate": 8.340100000000002e-06,
"loss": -0.0037,
"num_tokens": 1614944657.0,
"reward": 1.0615039229393006,
"reward_std": 0.16976474672555925,
"rewards/reward_accuracy/mean": 0.962109375,
"rewards/reward_accuracy/std": 0.16698972135782242,
"rewards/reward_format/mean": 0.09939453229308129,
"rewards/reward_format/std": 0.005333546851761639,
"sampling/importance_sampling_ratio/max": 2.7245090007781982,
"sampling/importance_sampling_ratio/mean": 0.9851636052131653,
"sampling/importance_sampling_ratio/min": 0.04341860562562942,
"sampling/sampling_logp_difference/max": 1.0139782845973968,
"sampling/sampling_logp_difference/mean": 0.0044290405232459305,
"step": 16600,
"step_time": 8.593861541798105
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00859375,
"completions/max_length": 1164.9,
"completions/max_terminated_length": 1070.3,
"completions/mean_length": 169.25078125,
"completions/mean_terminated_length": 153.31380310058594,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.047386300889775156,
"epoch": 35.56745182012848,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.339100000000001e-06,
"loss": -0.0038,
"num_tokens": 1615891891.0,
"reward": 1.0671289205551147,
"reward_std": 0.12832499742507936,
"rewards/reward_accuracy/mean": 0.967578125,
"rewards/reward_accuracy/std": 0.12661421298980713,
"rewards/reward_format/mean": 0.09955078214406968,
"rewards/reward_format/std": 0.003646313212811947,
"sampling/importance_sampling_ratio/max": 2.417126250267029,
"sampling/importance_sampling_ratio/mean": 0.9847851872444153,
"sampling/importance_sampling_ratio/min": 0.1296336233615875,
"sampling/sampling_logp_difference/max": 1.0325814247131349,
"sampling/sampling_logp_difference/mean": 0.004105464811436832,
"step": 16610,
"step_time": 6.0598098928050605
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 4.532291040959535e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.532291040959535e-06,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1101.6,
"completions/max_terminated_length": 981.0,
"completions/mean_length": 157.68203125,
"completions/mean_terminated_length": 148.7578155517578,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.040422122459858656,
"epoch": 35.58886509635974,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.10693359375,
"learning_rate": 8.3381e-06,
"loss": -0.0007,
"num_tokens": 1616821045.0,
"reward": 1.075097668170929,
"reward_std": 0.11206008940935135,
"rewards/reward_accuracy/mean": 0.975390625,
"rewards/reward_accuracy/std": 0.11069507747888566,
"rewards/reward_format/mean": 0.09970703125,
"rewards/reward_format/std": 0.0027651124401018023,
"sampling/importance_sampling_ratio/max": 2.3751394391059875,
"sampling/importance_sampling_ratio/mean": 0.980875837802887,
"sampling/importance_sampling_ratio/min": 0.1552634309977293,
"sampling/sampling_logp_difference/max": 0.9206721186637878,
"sampling/sampling_logp_difference/mean": 0.003730079042725265,
"step": 16620,
"step_time": 5.839185034998809
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1065.3,
"completions/max_terminated_length": 916.6,
"completions/mean_length": 137.137109375,
"completions/mean_terminated_length": 134.9087387084961,
"completions/min_length": 67.3,
"completions/min_terminated_length": 67.3,
"entropy": 0.03294354169629514,
"epoch": 35.610278372591004,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.087890625,
"learning_rate": 8.3371e-06,
"loss": -0.0034,
"num_tokens": 1617685876.0,
"reward": 1.087011742591858,
"reward_std": 0.08737870454788207,
"rewards/reward_accuracy/mean": 0.987109375,
"rewards/reward_accuracy/std": 0.08650011345744132,
"rewards/reward_format/mean": 0.09990234524011612,
"rewards/reward_format/std": 0.0013226743787527085,
"sampling/importance_sampling_ratio/max": 2.522256243228912,
"sampling/importance_sampling_ratio/mean": 0.9939361155033112,
"sampling/importance_sampling_ratio/min": 0.14619525969028474,
"sampling/sampling_logp_difference/max": 1.1038780629634857,
"sampling/sampling_logp_difference/mean": 0.003767493087798357,
"step": 16630,
"step_time": 5.216047416004585
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1054.4,
"completions/max_terminated_length": 833.2,
"completions/mean_length": 142.61640625,
"completions/mean_terminated_length": 138.92911071777343,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.03563340259715915,
"epoch": 35.63169164882227,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.3361e-06,
"loss": -0.0015,
"num_tokens": 1618564606.0,
"reward": 1.0701953411102294,
"reward_std": 0.12763285338878633,
"rewards/reward_accuracy/mean": 0.9703125,
"rewards/reward_accuracy/std": 0.12728590667247772,
"rewards/reward_format/mean": 0.09988281428813935,
"rewards/reward_format/std": 0.0013232229743152858,
"sampling/importance_sampling_ratio/max": 2.483181154727936,
"sampling/importance_sampling_ratio/mean": 0.9915848255157471,
"sampling/importance_sampling_ratio/min": 0.1612671546638012,
"sampling/sampling_logp_difference/max": 1.0912561058998107,
"sampling/sampling_logp_difference/mean": 0.003898378857411444,
"step": 16640,
"step_time": 5.097844930001884
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1364.3,
"completions/max_terminated_length": 973.0,
"completions/mean_length": 160.830859375,
"completions/mean_terminated_length": 151.17170104980468,
"completions/min_length": 62.6,
"completions/min_terminated_length": 62.6,
"entropy": 0.0407886263448745,
"epoch": 35.65310492505353,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.335100000000001e-06,
"loss": -0.0069,
"num_tokens": 1619494701.0,
"reward": 1.0703515887260437,
"reward_std": 0.14101036339998246,
"rewards/reward_accuracy/mean": 0.970703125,
"rewards/reward_accuracy/std": 0.13895541802048683,
"rewards/reward_format/mean": 0.09964843913912773,
"rewards/reward_format/std": 0.0033994981087744234,
"sampling/importance_sampling_ratio/max": 2.483576202392578,
"sampling/importance_sampling_ratio/mean": 0.9916764557361603,
"sampling/importance_sampling_ratio/min": 0.056211423873901364,
"sampling/sampling_logp_difference/max": 0.9557220995426178,
"sampling/sampling_logp_difference/mean": 0.004171628458425403,
"step": 16650,
"step_time": 6.618479701710749
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 549.7,
"completions/max_terminated_length": 549.7,
"completions/mean_length": 134.111328125,
"completions/mean_terminated_length": 134.111328125,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.03152562296018004,
"epoch": 35.6745182012848,
"frac_reward_zero_std": 0.975,
"grad_norm": 0.0,
"learning_rate": 8.3341e-06,
"loss": -0.0038,
"num_tokens": 1620352618.0,
"reward": 1.0921679973602294,
"reward_std": 0.03819033801555634,
"rewards/reward_accuracy/mean": 0.9921875,
"rewards/reward_accuracy/std": 0.03811737895011902,
"rewards/reward_format/mean": 0.09998046979308128,
"rewards/reward_format/std": 0.0003125000046566129,
"sampling/importance_sampling_ratio/max": 2.306631886959076,
"sampling/importance_sampling_ratio/mean": 0.9799898087978363,
"sampling/importance_sampling_ratio/min": 0.22669145241379737,
"sampling/sampling_logp_difference/max": 1.0474633574485779,
"sampling/sampling_logp_difference/mean": 0.00372707680799067,
"step": 16660,
"step_time": 2.9879920958192088
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1278.2,
"completions/max_terminated_length": 1216.4,
"completions/mean_length": 150.629296875,
"completions/mean_terminated_length": 146.24054107666015,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.03781431841198355,
"epoch": 35.69593147751606,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.28125,
"learning_rate": 8.3331e-06,
"loss": -0.0005,
"num_tokens": 1621246805.0,
"reward": 1.0704297184944154,
"reward_std": 0.138520797342062,
"rewards/reward_accuracy/mean": 0.970703125,
"rewards/reward_accuracy/std": 0.13742663860321044,
"rewards/reward_format/mean": 0.09972656443715096,
"rewards/reward_format/std": 0.002119214180856943,
"sampling/importance_sampling_ratio/max": 2.5390802383422852,
"sampling/importance_sampling_ratio/mean": 0.9864245176315307,
"sampling/importance_sampling_ratio/min": 0.12806181907653807,
"sampling/sampling_logp_difference/max": 1.0658544301986694,
"sampling/sampling_logp_difference/mean": 0.003810008056461811,
"step": 16670,
"step_time": 6.183908754997537
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1651.9,
"completions/max_terminated_length": 1208.4,
"completions/mean_length": 157.73125,
"completions/mean_terminated_length": 154.04099884033204,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.042677097208797934,
"epoch": 35.71734475374733,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.125,
"learning_rate": 8.332100000000001e-06,
"loss": -0.0085,
"num_tokens": 1622176325.0,
"reward": 1.0686328172683717,
"reward_std": 0.14750823602080346,
"rewards/reward_accuracy/mean": 0.96875,
"rewards/reward_accuracy/std": 0.14682100266218184,
"rewards/reward_format/mean": 0.09988281279802322,
"rewards/reward_format/std": 0.0018750001210719347,
"sampling/importance_sampling_ratio/max": 2.4722678899765014,
"sampling/importance_sampling_ratio/mean": 0.9902010440826416,
"sampling/importance_sampling_ratio/min": 0.11508107203990221,
"sampling/sampling_logp_difference/max": 1.0326999068260192,
"sampling/sampling_logp_difference/mean": 0.004275981429964304,
"step": 16680,
"step_time": 7.644900985294953
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 1284.3,
"completions/max_terminated_length": 1107.1,
"completions/mean_length": 175.548046875,
"completions/mean_terminated_length": 156.3138885498047,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"entropy": 0.04377172149252147,
"epoch": 35.738758029978584,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.16015625,
"learning_rate": 8.3311e-06,
"loss": -0.0036,
"num_tokens": 1623151328.0,
"reward": 1.0708203554153441,
"reward_std": 0.13248682841658593,
"rewards/reward_accuracy/mean": 0.971484375,
"rewards/reward_accuracy/std": 0.13016479536890985,
"rewards/reward_format/mean": 0.0993359386920929,
"rewards/reward_format/std": 0.0046938246116042135,
"sampling/importance_sampling_ratio/max": 2.5202752351760864,
"sampling/importance_sampling_ratio/mean": 0.9879194498062134,
"sampling/importance_sampling_ratio/min": 0.15026906616985797,
"sampling/sampling_logp_difference/max": 0.9316123723983765,
"sampling/sampling_logp_difference/mean": 0.004113228293135762,
"step": 16690,
"step_time": 6.439703496918082
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1483.4,
"completions/max_terminated_length": 1288.5,
"completions/mean_length": 163.787890625,
"completions/mean_terminated_length": 157.17032775878906,
"completions/min_length": 67.7,
"completions/min_terminated_length": 67.7,
"entropy": 0.04049685678910464,
"epoch": 35.76017130620985,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.201171875,
"learning_rate": 8.330100000000002e-06,
"loss": -0.0006,
"num_tokens": 1624081585.0,
"reward": 1.059472680091858,
"reward_std": 0.18425227627158164,
"rewards/reward_accuracy/mean": 0.959765625,
"rewards/reward_accuracy/std": 0.182978006452322,
"rewards/reward_format/mean": 0.09970703274011612,
"rewards/reward_format/std": 0.003059958410449326,
"sampling/importance_sampling_ratio/max": 2.5345240592956544,
"sampling/importance_sampling_ratio/mean": 0.990755957365036,
"sampling/importance_sampling_ratio/min": 0.10735330730676651,
"sampling/sampling_logp_difference/max": 0.9147871851921081,
"sampling/sampling_logp_difference/mean": 0.003951675374992192,
"step": 16700,
"step_time": 6.985968753998168
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 960.0,
"completions/max_terminated_length": 773.8,
"completions/mean_length": 143.097265625,
"completions/mean_terminated_length": 141.61247711181642,
"completions/min_length": 64.4,
"completions/min_terminated_length": 64.4,
"entropy": 0.03171767902094871,
"epoch": 35.78158458244111,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.408203125,
"learning_rate": 8.329100000000001e-06,
"loss": -0.0049,
"num_tokens": 1624965418.0,
"reward": 1.0956836104393006,
"reward_std": 0.04471321552991867,
"rewards/reward_accuracy/mean": 0.995703125,
"rewards/reward_accuracy/std": 0.04453052207827568,
"rewards/reward_format/mean": 0.09998046979308128,
"rewards/reward_format/std": 0.0003125000046566129,
"sampling/importance_sampling_ratio/max": 2.3928420662879946,
"sampling/importance_sampling_ratio/mean": 0.9920079708099365,
"sampling/importance_sampling_ratio/min": 0.2456461325287819,
"sampling/sampling_logp_difference/max": 0.9570783793926239,
"sampling/sampling_logp_difference/mean": 0.0035018070600926878,
"step": 16710,
"step_time": 4.776724062598078
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 791.8,
"completions/max_terminated_length": 706.5,
"completions/mean_length": 138.71171875,
"completions/mean_terminated_length": 137.97545166015624,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.03161973573733121,
"epoch": 35.80299785867238,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.58203125,
"learning_rate": 8.3281e-06,
"loss": -0.0031,
"num_tokens": 1625834792.0,
"reward": 1.084765648841858,
"reward_std": 0.0817948892712593,
"rewards/reward_accuracy/mean": 0.984765625,
"rewards/reward_accuracy/std": 0.08179489225149154,
"rewards/reward_format/mean": 0.10000000149011612,
"rewards/reward_format/std": 0.0,
"sampling/importance_sampling_ratio/max": 2.324520468711853,
"sampling/importance_sampling_ratio/mean": 0.9981642246246338,
"sampling/importance_sampling_ratio/min": 0.25055031329393385,
"sampling/sampling_logp_difference/max": 0.8870496988296509,
"sampling/sampling_logp_difference/mean": 0.003444003057666123,
"step": 16720,
"step_time": 4.137204613900394
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1415.2,
"completions/max_terminated_length": 1020.4,
"completions/mean_length": 163.6265625,
"completions/mean_terminated_length": 159.92305526733398,
"completions/min_length": 67.1,
"completions/min_terminated_length": 67.1,
"entropy": 0.03968970563728362,
"epoch": 35.82441113490364,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.3671875,
"learning_rate": 8.3271e-06,
"loss": -0.0022,
"num_tokens": 1626781020.0,
"reward": 1.0705859661102295,
"reward_std": 0.12766130566596984,
"rewards/reward_accuracy/mean": 0.970703125,
"rewards/reward_accuracy/std": 0.12715097814798354,
"rewards/reward_format/mean": 0.09988281428813935,
"rewards/reward_format/std": 0.0015071487054228784,
"sampling/importance_sampling_ratio/max": 2.4948187351226805,
"sampling/importance_sampling_ratio/mean": 0.9956787645816803,
"sampling/importance_sampling_ratio/min": 0.14572490602731705,
"sampling/sampling_logp_difference/max": 1.065236258506775,
"sampling/sampling_logp_difference/mean": 0.0040798387723043564,
"step": 16730,
"step_time": 6.70148568652221
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.25573057832662e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.25573057832662e-06,
"completions/clipped_ratio": 0.007421875,
"completions/max_length": 1404.4,
"completions/max_terminated_length": 1002.8,
"completions/mean_length": 163.25390625,
"completions/mean_terminated_length": 149.12774047851562,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.04076594174839556,
"epoch": 35.845824411134906,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.41796875,
"learning_rate": 8.3261e-06,
"loss": -0.0084,
"num_tokens": 1627714502.0,
"reward": 1.0696484565734863,
"reward_std": 0.13923025876283646,
"rewards/reward_accuracy/mean": 0.9703125,
"rewards/reward_accuracy/std": 0.13627480641007422,
"rewards/reward_format/mean": 0.0993359386920929,
"rewards/reward_format/std": 0.004047102737240493,
"sampling/importance_sampling_ratio/max": 2.471239674091339,
"sampling/importance_sampling_ratio/mean": 0.9884591996669769,
"sampling/importance_sampling_ratio/min": 0.14880207795649766,
"sampling/sampling_logp_difference/max": 0.9843007087707519,
"sampling/sampling_logp_difference/mean": 0.0040628567803651094,
"step": 16740,
"step_time": 6.7991390533105
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 708.7,
"completions/max_terminated_length": 528.8,
"completions/mean_length": 149.08515625,
"completions/mean_terminated_length": 144.7034469604492,
"completions/min_length": 72.4,
"completions/min_terminated_length": 72.4,
"entropy": 0.033885933458805084,
"epoch": 35.86723768736617,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.23828125,
"learning_rate": 8.325100000000001e-06,
"loss": -0.0034,
"num_tokens": 1628611632.0,
"reward": 1.071679711341858,
"reward_std": 0.10856535732746124,
"rewards/reward_accuracy/mean": 0.971875,
"rewards/reward_accuracy/std": 0.10786949396133423,
"rewards/reward_format/mean": 0.09980468899011612,
"rewards/reward_format/std": 0.0018676253035664558,
"sampling/importance_sampling_ratio/max": 2.5968374490737913,
"sampling/importance_sampling_ratio/mean": 0.9834044992923736,
"sampling/importance_sampling_ratio/min": 0.16985025703907014,
"sampling/sampling_logp_difference/max": 1.0032796204090118,
"sampling/sampling_logp_difference/mean": 0.00369625564198941,
"step": 16750,
"step_time": 3.793537507590372
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00703125,
"completions/max_length": 1369.1,
"completions/max_terminated_length": 1242.9,
"completions/mean_length": 179.812890625,
"completions/mean_terminated_length": 167.10973510742187,
"completions/min_length": 63.5,
"completions/min_terminated_length": 63.5,
"entropy": 0.04635952860116958,
"epoch": 35.88865096359743,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.1962890625,
"learning_rate": 8.3241e-06,
"loss": -0.0079,
"num_tokens": 1629596977.0,
"reward": 1.049882835149765,
"reward_std": 0.17574358955025673,
"rewards/reward_accuracy/mean": 0.950390625,
"rewards/reward_accuracy/std": 0.17444290295243264,
"rewards/reward_format/mean": 0.09949218928813934,
"rewards/reward_format/std": 0.0036689060973003505,
"sampling/importance_sampling_ratio/max": 2.4660306930541993,
"sampling/importance_sampling_ratio/mean": 0.9831955850124359,
"sampling/importance_sampling_ratio/min": 0.11112826312892139,
"sampling/sampling_logp_difference/max": 1.0495434761047364,
"sampling/sampling_logp_difference/mean": 0.004168483056128025,
"step": 16760,
"step_time": 6.940280692314263
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 846.6,
"completions/max_terminated_length": 818.2,
"completions/mean_length": 148.312890625,
"completions/mean_terminated_length": 145.38022155761718,
"completions/min_length": 62.1,
"completions/min_terminated_length": 62.1,
"entropy": 0.03300017903093248,
"epoch": 35.91006423982869,
"frac_reward_zero_std": 0.98125,
"grad_norm": 0.0,
"learning_rate": 8.3231e-06,
"loss": -0.0018,
"num_tokens": 1630493810.0,
"reward": 1.0775976777076721,
"reward_std": 0.07903242111206055,
"rewards/reward_accuracy/mean": 0.977734375,
"rewards/reward_accuracy/std": 0.07852273732423783,
"rewards/reward_format/mean": 0.09986328259110451,
"rewards/reward_format/std": 0.0013907782966271042,
"sampling/importance_sampling_ratio/max": 2.480143368244171,
"sampling/importance_sampling_ratio/mean": 0.9892591536045074,
"sampling/importance_sampling_ratio/min": 0.2145886480808258,
"sampling/sampling_logp_difference/max": 1.1869255781173706,
"sampling/sampling_logp_difference/mean": 0.003403732762672007,
"step": 16770,
"step_time": 4.393707009908394
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1260.4,
"completions/max_terminated_length": 1238.5,
"completions/mean_length": 146.25703125,
"completions/mean_terminated_length": 144.80577850341797,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.041305858013220134,
"epoch": 35.93147751605996,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.2119140625,
"learning_rate": 8.322100000000001e-06,
"loss": -0.0061,
"num_tokens": 1631378964.0,
"reward": 1.0701562643051148,
"reward_std": 0.1293718360364437,
"rewards/reward_accuracy/mean": 0.9703125,
"rewards/reward_accuracy/std": 0.12865586206316948,
"rewards/reward_format/mean": 0.09984375089406967,
"rewards/reward_format/std": 0.001630769087933004,
"sampling/importance_sampling_ratio/max": 2.4847580671310423,
"sampling/importance_sampling_ratio/mean": 0.9923129260540009,
"sampling/importance_sampling_ratio/min": 0.13733653500676155,
"sampling/sampling_logp_difference/max": 0.9791782379150391,
"sampling/sampling_logp_difference/mean": 0.004277592361904681,
"step": 16780,
"step_time": 6.042454081823235
},
{
"clip_ratio/high_max": 8.546034950995818e-06,
"clip_ratio/high_mean": 1.0682543688744773e-06,
"clip_ratio/low_mean": 1.3270079534777324e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.3952623223522095e-06,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1264.7,
"completions/max_terminated_length": 1100.3,
"completions/mean_length": 159.98046875,
"completions/mean_terminated_length": 149.74697875976562,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.04304876627866179,
"epoch": 35.95289079229122,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.2412109375,
"learning_rate": 8.3211e-06,
"loss": -0.0061,
"num_tokens": 1632311106.0,
"reward": 1.087597668170929,
"reward_std": 0.09279002398252487,
"rewards/reward_accuracy/mean": 0.987890625,
"rewards/reward_accuracy/std": 0.09114054888486862,
"rewards/reward_format/mean": 0.09970703199505807,
"rewards/reward_format/std": 0.002668620832264423,
"sampling/importance_sampling_ratio/max": 2.653280258178711,
"sampling/importance_sampling_ratio/mean": 0.9898922324180603,
"sampling/importance_sampling_ratio/min": 0.09432288743555546,
"sampling/sampling_logp_difference/max": 1.049621856212616,
"sampling/sampling_logp_difference/mean": 0.004039610642939806,
"step": 16790,
"step_time": 6.181705083412817
},
{
"clip_ratio/high_max": 3.942583207390271e-05,
"clip_ratio/high_mean": 4.9282290092378386e-06,
"clip_ratio/low_mean": 1.055267875926802e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 5.983496885164641e-06,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 999.1,
"completions/max_terminated_length": 855.0,
"completions/mean_length": 142.06953125,
"completions/mean_terminated_length": 131.7631088256836,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.03780613914132118,
"epoch": 35.974304068522486,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.0,
"learning_rate": 8.3201e-06,
"loss": 0.0053,
"num_tokens": 1633183844.0,
"reward": 1.0770117461681366,
"reward_std": 0.08988268896937371,
"rewards/reward_accuracy/mean": 0.97734375,
"rewards/reward_accuracy/std": 0.08831450268626213,
"rewards/reward_format/mean": 0.09966797009110451,
"rewards/reward_format/std": 0.0029257694259285927,
"sampling/importance_sampling_ratio/max": 2.4416415810585024,
"sampling/importance_sampling_ratio/mean": 0.9945643186569214,
"sampling/importance_sampling_ratio/min": 0.22679751962423325,
"sampling/sampling_logp_difference/max": 0.8411231994628906,
"sampling/sampling_logp_difference/mean": 0.003820716985501349,
"step": 16800,
"step_time": 5.093518897681497
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 993.2,
"completions/max_terminated_length": 963.5,
"completions/mean_length": 153.05234375,
"completions/mean_terminated_length": 146.48349304199218,
"completions/min_length": 61.7,
"completions/min_terminated_length": 61.7,
"entropy": 0.04326945198699832,
"epoch": 35.99571734475375,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.154296875,
"learning_rate": 8.319100000000001e-06,
"loss": -0.0024,
"num_tokens": 1634083546.0,
"reward": 1.0826172232627869,
"reward_std": 0.09762932807207107,
"rewards/reward_accuracy/mean": 0.9828125,
"rewards/reward_accuracy/std": 0.09726518765091896,
"rewards/reward_format/mean": 0.09980468973517417,
"rewards/reward_format/std": 0.0019445357378572226,
"sampling/importance_sampling_ratio/max": 2.628986692428589,
"sampling/importance_sampling_ratio/mean": 0.9900913119316102,
"sampling/importance_sampling_ratio/min": 0.1006898358464241,
"sampling/sampling_logp_difference/max": 0.9249450445175171,
"sampling/sampling_logp_difference/mean": 0.0040163301397114996,
"step": 16810,
"step_time": 5.219753842797945
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1342.1,
"completions/max_terminated_length": 1116.3,
"completions/mean_length": 167.442578125,
"completions/mean_terminated_length": 159.39326934814454,
"completions/min_length": 69.3,
"completions/min_terminated_length": 69.3,
"entropy": 0.040182948135770856,
"epoch": 36.01713062098501,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.0,
"learning_rate": 8.318100000000001e-06,
"loss": -0.0107,
"num_tokens": 1635031671.0,
"reward": 1.072265636920929,
"reward_std": 0.12369971722364426,
"rewards/reward_accuracy/mean": 0.97265625,
"rewards/reward_accuracy/std": 0.12179100662469863,
"rewards/reward_format/mean": 0.09960937574505806,
"rewards/reward_format/std": 0.003509024949744344,
"sampling/importance_sampling_ratio/max": 2.534204888343811,
"sampling/importance_sampling_ratio/mean": 0.981930536031723,
"sampling/importance_sampling_ratio/min": 0.09714533984661103,
"sampling/sampling_logp_difference/max": 1.0335193276405334,
"sampling/sampling_logp_difference/mean": 0.004007102176547051,
"step": 16820,
"step_time": 6.47496976100665
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 674.5,
"completions/max_terminated_length": 558.6,
"completions/mean_length": 141.78359375,
"completions/mean_terminated_length": 139.59192962646483,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.031274677417241034,
"epoch": 36.03854389721627,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.3171e-06,
"loss": -0.0012,
"num_tokens": 1635909501.0,
"reward": 1.0803125202655792,
"reward_std": 0.0866770550608635,
"rewards/reward_accuracy/mean": 0.98046875,
"rewards/reward_accuracy/std": 0.08586665242910385,
"rewards/reward_format/mean": 0.09984375089406967,
"rewards/reward_format/std": 0.0017032783478498458,
"sampling/importance_sampling_ratio/max": 2.513621520996094,
"sampling/importance_sampling_ratio/mean": 0.9864765703678131,
"sampling/importance_sampling_ratio/min": 0.15989703370723873,
"sampling/sampling_logp_difference/max": 1.1965598583221435,
"sampling/sampling_logp_difference/mean": 0.0036608319031074645,
"step": 16830,
"step_time": 3.686029956798302
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 949.5,
"completions/max_terminated_length": 831.0,
"completions/mean_length": 145.628125,
"completions/mean_terminated_length": 143.4047424316406,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.03508396039251238,
"epoch": 36.059957173447536,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.3161e-06,
"loss": 0.0031,
"num_tokens": 1636798517.0,
"reward": 1.0678906440734863,
"reward_std": 0.13351510614156722,
"rewards/reward_accuracy/mean": 0.96796875,
"rewards/reward_accuracy/std": 0.13325634300708772,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.0012500001117587089,
"sampling/importance_sampling_ratio/max": 2.499228072166443,
"sampling/importance_sampling_ratio/mean": 1.000488430261612,
"sampling/importance_sampling_ratio/min": 0.2009448952972889,
"sampling/sampling_logp_difference/max": 0.8299339771270752,
"sampling/sampling_logp_difference/mean": 0.0035814635921269655,
"step": 16840,
"step_time": 4.819716510208673
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1033.8,
"completions/max_terminated_length": 838.3,
"completions/mean_length": 145.261328125,
"completions/mean_terminated_length": 142.30104064941406,
"completions/min_length": 66.3,
"completions/min_terminated_length": 66.3,
"entropy": 0.03253389068413526,
"epoch": 36.0813704496788,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0,
"learning_rate": 8.315100000000001e-06,
"loss": 0.0014,
"num_tokens": 1637691090.0,
"reward": 1.0892969012260436,
"reward_std": 0.06980726942420006,
"rewards/reward_accuracy/mean": 0.989453125,
"rewards/reward_accuracy/std": 0.06878408566117286,
"rewards/reward_format/mean": 0.09984375163912773,
"rewards/reward_format/std": 0.0018923229770734906,
"sampling/importance_sampling_ratio/max": 2.3984856843948363,
"sampling/importance_sampling_ratio/mean": 0.9879953622817993,
"sampling/importance_sampling_ratio/min": 0.18578599002212287,
"sampling/sampling_logp_difference/max": 0.9897389709949493,
"sampling/sampling_logp_difference/mean": 0.0036446610698476433,
"step": 16850,
"step_time": 5.072532424188102
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 808.1,
"completions/max_terminated_length": 794.1,
"completions/mean_length": 153.198828125,
"completions/mean_terminated_length": 147.38431091308593,
"completions/min_length": 68.5,
"completions/min_terminated_length": 68.5,
"entropy": 0.03659339726436883,
"epoch": 36.102783725910065,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.3515625,
"learning_rate": 8.3141e-06,
"loss": -0.0014,
"num_tokens": 1638599999.0,
"reward": 1.0849023461341858,
"reward_std": 0.0756956659257412,
"rewards/reward_accuracy/mean": 0.98515625,
"rewards/reward_accuracy/std": 0.07460442036390305,
"rewards/reward_format/mean": 0.09974609389901161,
"rewards/reward_format/std": 0.00204362072981894,
"sampling/importance_sampling_ratio/max": 2.427100324630737,
"sampling/importance_sampling_ratio/mean": 0.9904575288295746,
"sampling/importance_sampling_ratio/min": 0.1430188849568367,
"sampling/sampling_logp_difference/max": 1.1514223098754883,
"sampling/sampling_logp_difference/mean": 0.003792649647220969,
"step": 16860,
"step_time": 4.459286060582963
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1337.8,
"completions/max_terminated_length": 1083.9,
"completions/mean_length": 154.2484375,
"completions/mean_terminated_length": 146.8650100708008,
"completions/min_length": 61.9,
"completions/min_terminated_length": 61.9,
"entropy": 0.038797540194354954,
"epoch": 36.12419700214133,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.1005859375,
"learning_rate": 8.3131e-06,
"loss": -0.0072,
"num_tokens": 1639511995.0,
"reward": 1.0734570384025575,
"reward_std": 0.1255304317222908,
"rewards/reward_accuracy/mean": 0.973828125,
"rewards/reward_accuracy/std": 0.12360360100865364,
"rewards/reward_format/mean": 0.09962890669703484,
"rewards/reward_format/std": 0.004114143806509674,
"sampling/importance_sampling_ratio/max": 2.465018057823181,
"sampling/importance_sampling_ratio/mean": 0.9834714651107788,
"sampling/importance_sampling_ratio/min": 0.08581177480518817,
"sampling/sampling_logp_difference/max": 0.9202985644340516,
"sampling/sampling_logp_difference/mean": 0.00384854762814939,
"step": 16870,
"step_time": 6.731278541096254
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1198.3,
"completions/max_terminated_length": 1151.2,
"completions/mean_length": 149.6796875,
"completions/mean_terminated_length": 143.05670166015625,
"completions/min_length": 62.3,
"completions/min_terminated_length": 62.3,
"entropy": 0.040614526043646036,
"epoch": 36.145610278372594,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.04736328125,
"learning_rate": 8.312100000000001e-06,
"loss": -0.0045,
"num_tokens": 1640411495.0,
"reward": 1.0779296994209289,
"reward_std": 0.11099743619561195,
"rewards/reward_accuracy/mean": 0.978125,
"rewards/reward_accuracy/std": 0.10995067059993743,
"rewards/reward_format/mean": 0.09980468899011612,
"rewards/reward_format/std": 0.0020492353942245245,
"sampling/importance_sampling_ratio/max": 2.3244585752487184,
"sampling/importance_sampling_ratio/mean": 0.9830375432968139,
"sampling/importance_sampling_ratio/min": 0.09987646192312241,
"sampling/sampling_logp_difference/max": 0.9317891597747803,
"sampling/sampling_logp_difference/mean": 0.004011388961225748,
"step": 16880,
"step_time": 6.138927051305655
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1318.9,
"completions/max_terminated_length": 959.9,
"completions/mean_length": 154.122265625,
"completions/mean_terminated_length": 151.90689926147462,
"completions/min_length": 64.6,
"completions/min_terminated_length": 64.6,
"entropy": 0.04044674562755972,
"epoch": 36.16702355460385,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.083984375,
"learning_rate": 8.3111e-06,
"loss": -0.0017,
"num_tokens": 1641326656.0,
"reward": 1.0658984541893006,
"reward_std": 0.1444559197174385,
"rewards/reward_accuracy/mean": 0.966015625,
"rewards/reward_accuracy/std": 0.14375731721520424,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.0013879599515348672,
"sampling/importance_sampling_ratio/max": 2.5924491047859193,
"sampling/importance_sampling_ratio/mean": 0.9918780744075775,
"sampling/importance_sampling_ratio/min": 0.03715047836303711,
"sampling/sampling_logp_difference/max": 1.0405516028404236,
"sampling/sampling_logp_difference/mean": 0.004011666495352983,
"step": 16890,
"step_time": 6.275921866323915
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1067.2,
"completions/max_terminated_length": 1018.5,
"completions/mean_length": 145.459375,
"completions/mean_terminated_length": 142.53250427246093,
"completions/min_length": 67.4,
"completions/min_terminated_length": 67.4,
"entropy": 0.03674842419568449,
"epoch": 36.188436830835116,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.361328125,
"learning_rate": 8.3101e-06,
"loss": -0.0049,
"num_tokens": 1642218488.0,
"reward": 1.0670508027076722,
"reward_std": 0.1375821441411972,
"rewards/reward_accuracy/mean": 0.9671875,
"rewards/reward_accuracy/std": 0.1371540203690529,
"rewards/reward_format/mean": 0.09986328259110451,
"rewards/reward_format/std": 0.0018196488032117485,
"sampling/importance_sampling_ratio/max": 2.334429621696472,
"sampling/importance_sampling_ratio/mean": 0.9854076325893402,
"sampling/importance_sampling_ratio/min": 0.08803983926773071,
"sampling/sampling_logp_difference/max": 0.9237225830554963,
"sampling/sampling_logp_difference/mean": 0.004001390165649354,
"step": 16900,
"step_time": 5.307824641311891
},
{
"clip_ratio/high_max": 2.0547944586724043e-05,
"clip_ratio/high_mean": 2.5684930733405054e-06,
"clip_ratio/low_mean": 7.518043275922537e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.320297400932759e-06,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 1243.4,
"completions/max_terminated_length": 940.4,
"completions/mean_length": 164.428125,
"completions/mean_terminated_length": 152.6092544555664,
"completions/min_length": 69.3,
"completions/min_terminated_length": 69.3,
"entropy": 0.03967396724037826,
"epoch": 36.20985010706638,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.1220703125,
"learning_rate": 8.309100000000001e-06,
"loss": -0.0038,
"num_tokens": 1643159200.0,
"reward": 1.0750195503234863,
"reward_std": 0.12954291179776192,
"rewards/reward_accuracy/mean": 0.975390625,
"rewards/reward_accuracy/std": 0.1277281418442726,
"rewards/reward_format/mean": 0.09962890818715095,
"rewards/reward_format/std": 0.0036118451738730074,
"sampling/importance_sampling_ratio/max": 2.521997308731079,
"sampling/importance_sampling_ratio/mean": 0.9821232736110688,
"sampling/importance_sampling_ratio/min": 0.10912741907723103,
"sampling/sampling_logp_difference/max": 1.5655581593513488,
"sampling/sampling_logp_difference/mean": 0.00392705537378788,
"step": 16910,
"step_time": 6.173269391784561
},
{
"clip_ratio/high_max": 1.4621251466451213e-05,
"clip_ratio/high_mean": 1.8276564333064016e-06,
"clip_ratio/low_mean": 2.1207039708315277e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.948360404137929e-06,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 1191.7,
"completions/max_terminated_length": 1091.8,
"completions/mean_length": 174.058984375,
"completions/mean_terminated_length": 155.77727661132812,
"completions/min_length": 62.6,
"completions/min_terminated_length": 62.6,
"entropy": 0.04569540894590318,
"epoch": 36.231263383297645,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.308100000000001e-06,
"loss": -0.0053,
"num_tokens": 1644122439.0,
"reward": 1.0589453339576722,
"reward_std": 0.17132573947310448,
"rewards/reward_accuracy/mean": 0.959765625,
"rewards/reward_accuracy/std": 0.16801088079810142,
"rewards/reward_format/mean": 0.09917968958616256,
"rewards/reward_format/std": 0.004934235778637231,
"sampling/importance_sampling_ratio/max": 2.529524254798889,
"sampling/importance_sampling_ratio/mean": 0.9782518029212952,
"sampling/importance_sampling_ratio/min": 0.10802633017301559,
"sampling/sampling_logp_difference/max": 1.198913812637329,
"sampling/sampling_logp_difference/mean": 0.004129257658496499,
"step": 16920,
"step_time": 6.249358621687861
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 640.9,
"completions/max_terminated_length": 379.7,
"completions/mean_length": 135.507421875,
"completions/mean_terminated_length": 133.2692672729492,
"completions/min_length": 64.4,
"completions/min_terminated_length": 64.4,
"entropy": 0.029867205838672816,
"epoch": 36.25267665952891,
"frac_reward_zero_std": 0.975,
"grad_norm": 0.5390625,
"learning_rate": 8.3071e-06,
"loss": 0.0028,
"num_tokens": 1644983562.0,
"reward": 1.0781250238418578,
"reward_std": 0.09609008803963662,
"rewards/reward_accuracy/mean": 0.978125,
"rewards/reward_accuracy/std": 0.09609009549021721,
"rewards/reward_format/mean": 0.10000000149011612,
"rewards/reward_format/std": 0.0,
"sampling/importance_sampling_ratio/max": 2.3627597808837892,
"sampling/importance_sampling_ratio/mean": 0.994727474451065,
"sampling/importance_sampling_ratio/min": 0.24681287705898286,
"sampling/sampling_logp_difference/max": 1.0587978601455688,
"sampling/sampling_logp_difference/mean": 0.0033636394422501326,
"step": 16930,
"step_time": 3.4287586897116853
},
{
"clip_ratio/high_max": 2.812037491821684e-05,
"clip_ratio/high_mean": 3.515046864777105e-06,
"clip_ratio/low_mean": 3.655825821624603e-07,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 3.880629446939565e-06,
"completions/clipped_ratio": 0.011328125,
"completions/max_length": 1617.3,
"completions/max_terminated_length": 1288.0,
"completions/mean_length": 173.137890625,
"completions/mean_terminated_length": 151.6918502807617,
"completions/min_length": 70.6,
"completions/min_terminated_length": 70.6,
"entropy": 0.041604144219309094,
"epoch": 36.27408993576017,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.045654296875,
"learning_rate": 8.3061e-06,
"loss": -0.0019,
"num_tokens": 1645950459.0,
"reward": 1.0793750405311584,
"reward_std": 0.12157879918813705,
"rewards/reward_accuracy/mean": 0.980078125,
"rewards/reward_accuracy/std": 0.11824235618114472,
"rewards/reward_format/mean": 0.09929687753319741,
"rewards/reward_format/std": 0.004631900787353515,
"sampling/importance_sampling_ratio/max": 2.524004316329956,
"sampling/importance_sampling_ratio/mean": 0.9855282843112946,
"sampling/importance_sampling_ratio/min": 0.06364565463736653,
"sampling/sampling_logp_difference/max": 0.9785195589065552,
"sampling/sampling_logp_difference/mean": 0.0039444284979254,
"step": 16940,
"step_time": 7.897698314106674
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1142.9,
"completions/max_terminated_length": 902.1,
"completions/mean_length": 162.541015625,
"completions/mean_terminated_length": 153.78460083007812,
"completions/min_length": 67.9,
"completions/min_terminated_length": 67.9,
"entropy": 0.04243669423740357,
"epoch": 36.29550321199144,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.275390625,
"learning_rate": 8.305100000000001e-06,
"loss": -0.003,
"num_tokens": 1646885780.0,
"reward": 1.066894543170929,
"reward_std": 0.14491728246212005,
"rewards/reward_accuracy/mean": 0.9671875,
"rewards/reward_accuracy/std": 0.1436668261885643,
"rewards/reward_format/mean": 0.09970703199505807,
"rewards/reward_format/std": 0.0027287610806524753,
"sampling/importance_sampling_ratio/max": 2.5595563650131226,
"sampling/importance_sampling_ratio/mean": 0.9938982009887696,
"sampling/importance_sampling_ratio/min": 0.16485346630215644,
"sampling/sampling_logp_difference/max": 0.9741186738014221,
"sampling/sampling_logp_difference/mean": 0.004169066157191992,
"step": 16950,
"step_time": 5.797338799104909
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1272.1,
"completions/max_terminated_length": 1083.6,
"completions/mean_length": 151.363671875,
"completions/mean_terminated_length": 147.65506134033203,
"completions/min_length": 70.1,
"completions/min_terminated_length": 70.1,
"entropy": 0.03668780352454633,
"epoch": 36.316916488222695,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.0,
"learning_rate": 8.3041e-06,
"loss": -0.0014,
"num_tokens": 1647785431.0,
"reward": 1.0619726777076721,
"reward_std": 0.1343804754316807,
"rewards/reward_accuracy/mean": 0.962109375,
"rewards/reward_accuracy/std": 0.13390858545899392,
"rewards/reward_format/mean": 0.09986328259110451,
"rewards/reward_format/std": 0.0019476743880659341,
"sampling/importance_sampling_ratio/max": 2.4659452557563784,
"sampling/importance_sampling_ratio/mean": 0.9935767412185669,
"sampling/importance_sampling_ratio/min": 0.15311926156282424,
"sampling/sampling_logp_difference/max": 0.9619999170303345,
"sampling/sampling_logp_difference/mean": 0.0037771575385704636,
"step": 16960,
"step_time": 6.056351512105903
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1047.8,
"completions/max_terminated_length": 842.8,
"completions/mean_length": 158.883203125,
"completions/mean_terminated_length": 151.60555419921874,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.038676865259185435,
"epoch": 36.33832976445396,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.09619140625,
"learning_rate": 8.3031e-06,
"loss": -0.0013,
"num_tokens": 1648711308.0,
"reward": 1.050195324420929,
"reward_std": 0.19829256162047387,
"rewards/reward_accuracy/mean": 0.950390625,
"rewards/reward_accuracy/std": 0.1975794516503811,
"rewards/reward_format/mean": 0.09980468899011612,
"rewards/reward_format/std": 0.0023282784037292003,
"sampling/importance_sampling_ratio/max": 2.3101432800292967,
"sampling/importance_sampling_ratio/mean": 0.9821962952613831,
"sampling/importance_sampling_ratio/min": 0.07184472874990337,
"sampling/sampling_logp_difference/max": 2.6562817454338075,
"sampling/sampling_logp_difference/mean": 0.0038169432897120713,
"step": 16970,
"step_time": 5.454293684981531
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1342.3,
"completions/max_terminated_length": 1181.7,
"completions/mean_length": 152.287890625,
"completions/mean_terminated_length": 150.05541229248047,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.03673783759586513,
"epoch": 36.359743040685224,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.259765625,
"learning_rate": 8.302100000000001e-06,
"loss": -0.0056,
"num_tokens": 1649616413.0,
"reward": 1.0842578172683717,
"reward_std": 0.09986273795366288,
"rewards/reward_accuracy/mean": 0.984375,
"rewards/reward_accuracy/std": 0.09896428138017654,
"rewards/reward_format/mean": 0.09988281279802322,
"rewards/reward_format/std": 0.0018750001210719347,
"sampling/importance_sampling_ratio/max": 2.628732204437256,
"sampling/importance_sampling_ratio/mean": 0.9912784397602081,
"sampling/importance_sampling_ratio/min": 0.0467779353260994,
"sampling/sampling_logp_difference/max": 0.9455727458000183,
"sampling/sampling_logp_difference/mean": 0.003792191599495709,
"step": 16980,
"step_time": 6.403077074408065
},
{
"clip_ratio/high_max": 2.3454459733329713e-05,
"clip_ratio/high_mean": 2.931807466666214e-06,
"clip_ratio/low_mean": 5.3330096761783356e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 8.264817097369814e-06,
"completions/clipped_ratio": 0.012890625,
"completions/max_length": 1949.6,
"completions/max_terminated_length": 1313.7,
"completions/mean_length": 180.214453125,
"completions/mean_terminated_length": 155.77666931152345,
"completions/min_length": 66.4,
"completions/min_terminated_length": 66.4,
"entropy": 0.05279324166476727,
"epoch": 36.38115631691649,
"frac_reward_zero_std": 0.83125,
"grad_norm": 1.09375,
"learning_rate": 8.301100000000001e-06,
"loss": -0.0108,
"num_tokens": 1650601090.0,
"reward": 1.0615820288658142,
"reward_std": 0.1805962324142456,
"rewards/reward_accuracy/mean": 0.9625,
"rewards/reward_accuracy/std": 0.1760316088795662,
"rewards/reward_format/mean": 0.09908203110098839,
"rewards/reward_format/std": 0.007781862863339484,
"sampling/importance_sampling_ratio/max": 2.5755242586135862,
"sampling/importance_sampling_ratio/mean": 0.9766068935394288,
"sampling/importance_sampling_ratio/min": 0.07973977643996477,
"sampling/sampling_logp_difference/max": 1.0598124623298646,
"sampling/sampling_logp_difference/mean": 0.00431001796387136,
"step": 16990,
"step_time": 9.216570341197075
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1408.3,
"completions/max_terminated_length": 1018.9,
"completions/mean_length": 151.178515625,
"completions/mean_terminated_length": 142.29333267211913,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.03715283463243395,
"epoch": 36.40256959314775,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.3001e-06,
"loss": -0.0058,
"num_tokens": 1651504091.0,
"reward": 1.0687304854393005,
"reward_std": 0.1346093848347664,
"rewards/reward_accuracy/mean": 0.969140625,
"rewards/reward_accuracy/std": 0.13188508078455924,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.003916825470514596,
"sampling/importance_sampling_ratio/max": 2.29284987449646,
"sampling/importance_sampling_ratio/mean": 0.9928920865058899,
"sampling/importance_sampling_ratio/min": 0.119593057455495,
"sampling/sampling_logp_difference/max": 1.034817737340927,
"sampling/sampling_logp_difference/mean": 0.0036990506574511527,
"step": 17000,
"step_time": 6.745136571215698
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1040.8,
"completions/max_terminated_length": 816.6,
"completions/mean_length": 153.945703125,
"completions/mean_terminated_length": 150.26326446533204,
"completions/min_length": 62.9,
"completions/min_terminated_length": 62.9,
"entropy": 0.03334321279544383,
"epoch": 36.42398286937902,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.299100000000002e-06,
"loss": 0.0005,
"num_tokens": 1652417952.0,
"reward": 1.0799219012260437,
"reward_std": 0.09810726940631867,
"rewards/reward_accuracy/mean": 0.980078125,
"rewards/reward_accuracy/std": 0.0976080134510994,
"rewards/reward_format/mean": 0.09984375163912773,
"rewards/reward_format/std": 0.0017337878001853825,
"sampling/importance_sampling_ratio/max": 2.4135416626930235,
"sampling/importance_sampling_ratio/mean": 0.9843147456645965,
"sampling/importance_sampling_ratio/min": 0.10092815235257149,
"sampling/sampling_logp_difference/max": 1.0086387872695923,
"sampling/sampling_logp_difference/mean": 0.0035782578634098172,
"step": 17010,
"step_time": 5.156472689996008
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1413.2,
"completions/max_terminated_length": 1040.6,
"completions/mean_length": 161.84140625,
"completions/mean_terminated_length": 156.7293273925781,
"completions/min_length": 71.3,
"completions/min_terminated_length": 71.3,
"entropy": 0.037371314712800086,
"epoch": 36.44539614561028,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.298100000000001e-06,
"loss": -0.0089,
"num_tokens": 1653351082.0,
"reward": 1.0626562535762787,
"reward_std": 0.14666605324018747,
"rewards/reward_accuracy/mean": 0.962890625,
"rewards/reward_accuracy/std": 0.14542350322008132,
"rewards/reward_format/mean": 0.09976562485098839,
"rewards/reward_format/std": 0.0026831001741811633,
"sampling/importance_sampling_ratio/max": 2.3859476804733277,
"sampling/importance_sampling_ratio/mean": 0.9955561637878418,
"sampling/importance_sampling_ratio/min": 0.044393789023160934,
"sampling/sampling_logp_difference/max": 1.150555384159088,
"sampling/sampling_logp_difference/mean": 0.0038356140488758684,
"step": 17020,
"step_time": 6.6455835089902395
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1458.0,
"completions/max_terminated_length": 1268.4,
"completions/mean_length": 158.598828125,
"completions/mean_terminated_length": 149.0298309326172,
"completions/min_length": 60.4,
"completions/min_terminated_length": 60.4,
"entropy": 0.039771976554766296,
"epoch": 36.46680942184154,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.1513671875,
"learning_rate": 8.2971e-06,
"loss": -0.0041,
"num_tokens": 1654271879.0,
"reward": 1.061289083957672,
"reward_std": 0.15683976858854293,
"rewards/reward_accuracy/mean": 0.96171875,
"rewards/reward_accuracy/std": 0.15503730177879332,
"rewards/reward_format/mean": 0.09957031384110451,
"rewards/reward_format/std": 0.004621500452049077,
"sampling/importance_sampling_ratio/max": 2.5172146558761597,
"sampling/importance_sampling_ratio/mean": 0.9808624982833862,
"sampling/importance_sampling_ratio/min": 0.0670075623318553,
"sampling/sampling_logp_difference/max": 0.9695408463478088,
"sampling/sampling_logp_difference/mean": 0.003790439572185278,
"step": 17030,
"step_time": 7.246429920205264
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1275.5,
"completions/max_terminated_length": 1169.1,
"completions/mean_length": 146.88125,
"completions/mean_terminated_length": 141.74279708862304,
"completions/min_length": 64.2,
"completions/min_terminated_length": 64.2,
"entropy": 0.037290448090061545,
"epoch": 36.4882226980728,
"frac_reward_zero_std": 0.96875,
"grad_norm": 0.0,
"learning_rate": 8.2961e-06,
"loss": -0.0016,
"num_tokens": 1655161415.0,
"reward": 1.0665234565734862,
"reward_std": 0.14684032872319222,
"rewards/reward_accuracy/mean": 0.966796875,
"rewards/reward_accuracy/std": 0.145133812725544,
"rewards/reward_format/mean": 0.09972656294703483,
"rewards/reward_format/std": 0.002487065643072128,
"sampling/importance_sampling_ratio/max": 2.4948240756988525,
"sampling/importance_sampling_ratio/mean": 0.9907842457294465,
"sampling/importance_sampling_ratio/min": 0.18625664785504342,
"sampling/sampling_logp_difference/max": 1.202278983592987,
"sampling/sampling_logp_difference/mean": 0.00371233238838613,
"step": 17040,
"step_time": 6.462979807300144
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1280.9,
"completions/max_terminated_length": 1249.0,
"completions/mean_length": 149.4265625,
"completions/mean_terminated_length": 142.7426986694336,
"completions/min_length": 60.4,
"completions/min_terminated_length": 60.4,
"entropy": 0.03867158922366798,
"epoch": 36.50963597430407,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.6640625,
"learning_rate": 8.2951e-06,
"loss": -0.0038,
"num_tokens": 1656055211.0,
"reward": 1.0629687547683715,
"reward_std": 0.13966271982062609,
"rewards/reward_accuracy/mean": 0.96328125,
"rewards/reward_accuracy/std": 0.13830619677901268,
"rewards/reward_format/mean": 0.09968750029802323,
"rewards/reward_format/std": 0.0027658477891236545,
"sampling/importance_sampling_ratio/max": 2.405160140991211,
"sampling/importance_sampling_ratio/mean": 0.9873395264148712,
"sampling/importance_sampling_ratio/min": 0.12078722603619099,
"sampling/sampling_logp_difference/max": 1.0227676153182983,
"sampling/sampling_logp_difference/mean": 0.004029661417007446,
"step": 17050,
"step_time": 6.081206371702137
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1090.0,
"completions/max_terminated_length": 904.5,
"completions/mean_length": 145.88515625,
"completions/mean_terminated_length": 141.4325958251953,
"completions/min_length": 62.5,
"completions/min_terminated_length": 62.5,
"entropy": 0.036328899580985306,
"epoch": 36.53104925053533,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.337890625,
"learning_rate": 8.2941e-06,
"loss": -0.0012,
"num_tokens": 1656946405.0,
"reward": 1.083105480670929,
"reward_std": 0.0902577817440033,
"rewards/reward_accuracy/mean": 0.983203125,
"rewards/reward_accuracy/std": 0.08980262279510498,
"rewards/reward_format/mean": 0.09990234449505805,
"rewards/reward_format/std": 0.0013226743321865797,
"sampling/importance_sampling_ratio/max": 2.4461857080459595,
"sampling/importance_sampling_ratio/mean": 0.995442795753479,
"sampling/importance_sampling_ratio/min": 0.18515627533197404,
"sampling/sampling_logp_difference/max": 1.0429230809211731,
"sampling/sampling_logp_difference/mean": 0.003748582396656275,
"step": 17060,
"step_time": 5.4439201353117825
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1142.9,
"completions/max_terminated_length": 1136.1,
"completions/mean_length": 159.31484375,
"completions/mean_terminated_length": 154.98826293945314,
"completions/min_length": 70.0,
"completions/min_terminated_length": 70.0,
"entropy": 0.03822410139255226,
"epoch": 36.5524625267666,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.2931e-06,
"loss": -0.0072,
"num_tokens": 1657884283.0,
"reward": 1.0657812714576722,
"reward_std": 0.14616535604000092,
"rewards/reward_accuracy/mean": 0.966015625,
"rewards/reward_accuracy/std": 0.14522664919495581,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0015158477239310742,
"sampling/importance_sampling_ratio/max": 2.4262857675552367,
"sampling/importance_sampling_ratio/mean": 0.9994497299194336,
"sampling/importance_sampling_ratio/min": 0.17626017332077026,
"sampling/sampling_logp_difference/max": 1.1124844551086426,
"sampling/sampling_logp_difference/mean": 0.003925882000476122,
"step": 17070,
"step_time": 5.654008382899337
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 905.0,
"completions/max_terminated_length": 752.0,
"completions/mean_length": 137.888671875,
"completions/mean_terminated_length": 136.40493774414062,
"completions/min_length": 64.5,
"completions/min_terminated_length": 64.5,
"entropy": 0.03556930697523057,
"epoch": 36.57387580299786,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.353515625,
"learning_rate": 8.292100000000001e-06,
"loss": -0.0006,
"num_tokens": 1658756094.0,
"reward": 1.069101583957672,
"reward_std": 0.13145462945103645,
"rewards/reward_accuracy/mean": 0.969140625,
"rewards/reward_accuracy/std": 0.13100298643112182,
"rewards/reward_format/mean": 0.0999609388411045,
"rewards/reward_format/std": 0.0006250000558793544,
"sampling/importance_sampling_ratio/max": 2.5155985713005067,
"sampling/importance_sampling_ratio/mean": 0.9938471376895904,
"sampling/importance_sampling_ratio/min": 0.0985710334032774,
"sampling/sampling_logp_difference/max": 0.9992462635040283,
"sampling/sampling_logp_difference/mean": 0.0039189182687550785,
"step": 17080,
"step_time": 4.539075492593111
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1075.9,
"completions/max_terminated_length": 980.6,
"completions/mean_length": 145.892578125,
"completions/mean_terminated_length": 144.4189453125,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.035543914511799814,
"epoch": 36.59528907922912,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.291100000000001e-06,
"loss": -0.0063,
"num_tokens": 1659644347.0,
"reward": 1.069824230670929,
"reward_std": 0.13817696422338485,
"rewards/reward_accuracy/mean": 0.969921875,
"rewards/reward_accuracy/std": 0.13734295219182968,
"rewards/reward_format/mean": 0.09990234449505805,
"rewards/reward_format/std": 0.001562500116415322,
"sampling/importance_sampling_ratio/max": 2.390057897567749,
"sampling/importance_sampling_ratio/mean": 0.9966626822948456,
"sampling/importance_sampling_ratio/min": 0.21511825025081635,
"sampling/sampling_logp_difference/max": 0.8777547478675842,
"sampling/sampling_logp_difference/mean": 0.0038092795526608824,
"step": 17090,
"step_time": 5.381065381178632
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1068.2,
"completions/max_terminated_length": 1029.3,
"completions/mean_length": 155.273046875,
"completions/mean_terminated_length": 153.0869400024414,
"completions/min_length": 69.7,
"completions/min_terminated_length": 69.7,
"entropy": 0.03648603786714375,
"epoch": 36.61670235546038,
"frac_reward_zero_std": 0.96875,
"grad_norm": 0.0,
"learning_rate": 8.2901e-06,
"loss": 0.001,
"num_tokens": 1660559110.0,
"reward": 1.0690234661102296,
"reward_std": 0.12193958386778832,
"rewards/reward_accuracy/mean": 0.969140625,
"rewards/reward_accuracy/std": 0.12149148061871529,
"rewards/reward_format/mean": 0.09988281428813935,
"rewards/reward_format/std": 0.0015071487985551357,
"sampling/importance_sampling_ratio/max": 2.672808575630188,
"sampling/importance_sampling_ratio/mean": 0.9921915411949158,
"sampling/importance_sampling_ratio/min": 0.10950253829360009,
"sampling/sampling_logp_difference/max": 1.093976378440857,
"sampling/sampling_logp_difference/mean": 0.003894804255105555,
"step": 17100,
"step_time": 5.303395372102386
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 1281.7,
"completions/max_terminated_length": 791.2,
"completions/mean_length": 146.93828125,
"completions/mean_terminated_length": 143.96123962402345,
"completions/min_length": 61.3,
"completions/min_terminated_length": 61.3,
"entropy": 0.039077860116958615,
"epoch": 36.63811563169165,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0908203125,
"learning_rate": 8.289100000000002e-06,
"loss": 0.0022,
"num_tokens": 1661449336.0,
"reward": 1.0792382955551147,
"reward_std": 0.09695398837793619,
"rewards/reward_accuracy/mean": 0.979296875,
"rewards/reward_accuracy/std": 0.09601649418473243,
"rewards/reward_format/mean": 0.09994140714406967,
"rewards/reward_format/std": 0.0009375000605359674,
"sampling/importance_sampling_ratio/max": 2.498087453842163,
"sampling/importance_sampling_ratio/mean": 0.9905408084392547,
"sampling/importance_sampling_ratio/min": 0.14092907086014747,
"sampling/sampling_logp_difference/max": 1.0411601662635803,
"sampling/sampling_logp_difference/mean": 0.004098052205517888,
"step": 17110,
"step_time": 6.049562750707264
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1145.3,
"completions/max_terminated_length": 1103.2,
"completions/mean_length": 149.99609375,
"completions/mean_terminated_length": 146.3893264770508,
"completions/min_length": 66.5,
"completions/min_terminated_length": 66.5,
"entropy": 0.03714279739651829,
"epoch": 36.65952890792291,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.451171875,
"learning_rate": 8.288100000000001e-06,
"loss": -0.0043,
"num_tokens": 1662348142.0,
"reward": 1.0880664229393004,
"reward_std": 0.08311840072274208,
"rewards/reward_accuracy/mean": 0.98828125,
"rewards/reward_accuracy/std": 0.08222481235861778,
"rewards/reward_format/mean": 0.09978515729308128,
"rewards/reward_format/std": 0.0019039240200072528,
"sampling/importance_sampling_ratio/max": 2.302826929092407,
"sampling/importance_sampling_ratio/mean": 0.9854251265525817,
"sampling/importance_sampling_ratio/min": 0.1326166344806552,
"sampling/sampling_logp_difference/max": 0.8530317187309265,
"sampling/sampling_logp_difference/mean": 0.003846322768367827,
"step": 17120,
"step_time": 5.7854515028040625
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 687.3,
"completions/max_terminated_length": 543.6,
"completions/mean_length": 140.688671875,
"completions/mean_terminated_length": 139.94416046142578,
"completions/min_length": 73.7,
"completions/min_terminated_length": 73.7,
"entropy": 0.030649089650250972,
"epoch": 36.680942184154176,
"frac_reward_zero_std": 0.96875,
"grad_norm": 0.1396484375,
"learning_rate": 8.2871e-06,
"loss": -0.0021,
"num_tokens": 1663229089.0,
"reward": 1.0851562738418579,
"reward_std": 0.06931523829698563,
"rewards/reward_accuracy/mean": 0.98515625,
"rewards/reward_accuracy/std": 0.06931524276733399,
"rewards/reward_format/mean": 0.10000000149011612,
"rewards/reward_format/std": 0.0,
"sampling/importance_sampling_ratio/max": 2.54150071144104,
"sampling/importance_sampling_ratio/mean": 1.0017311215400695,
"sampling/importance_sampling_ratio/min": 0.09499011039733887,
"sampling/sampling_logp_difference/max": 1.0073742270469666,
"sampling/sampling_logp_difference/mean": 0.003474831744097173,
"step": 17130,
"step_time": 3.5621364356891716
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 816.8,
"completions/max_terminated_length": 816.8,
"completions/mean_length": 136.6078125,
"completions/mean_terminated_length": 136.6078125,
"completions/min_length": 61.6,
"completions/min_terminated_length": 61.6,
"entropy": 0.03408970923628658,
"epoch": 36.70235546038544,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.0,
"learning_rate": 8.2861e-06,
"loss": -0.0053,
"num_tokens": 1664095637.0,
"reward": 1.0890234589576722,
"reward_std": 0.058588650077581406,
"rewards/reward_accuracy/mean": 0.9890625,
"rewards/reward_accuracy/std": 0.058294524997472764,
"rewards/reward_format/mean": 0.09996093809604645,
"rewards/reward_format/std": 0.0006250000093132258,
"sampling/importance_sampling_ratio/max": 2.390671980381012,
"sampling/importance_sampling_ratio/mean": 0.9973479568958282,
"sampling/importance_sampling_ratio/min": 0.1768207333981991,
"sampling/sampling_logp_difference/max": 1.0908993482589722,
"sampling/sampling_logp_difference/mean": 0.003636231366544962,
"step": 17140,
"step_time": 4.118421878613299
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1407.1,
"completions/max_terminated_length": 1165.9,
"completions/mean_length": 162.785546875,
"completions/mean_terminated_length": 155.5310920715332,
"completions/min_length": 63.4,
"completions/min_terminated_length": 63.4,
"entropy": 0.04070211336947978,
"epoch": 36.723768736616705,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.062255859375,
"learning_rate": 8.2851e-06,
"loss": -0.0,
"num_tokens": 1665026880.0,
"reward": 1.0578125238418579,
"reward_std": 0.15249436125159263,
"rewards/reward_accuracy/mean": 0.958203125,
"rewards/reward_accuracy/std": 0.15101729929447175,
"rewards/reward_format/mean": 0.09960937649011611,
"rewards/reward_format/std": 0.003647996485233307,
"sampling/importance_sampling_ratio/max": 2.3021372318267823,
"sampling/importance_sampling_ratio/mean": 0.9845538079738617,
"sampling/importance_sampling_ratio/min": 0.1075875809416175,
"sampling/sampling_logp_difference/max": 0.9257954061031342,
"sampling/sampling_logp_difference/mean": 0.0037276413757354023,
"step": 17150,
"step_time": 7.0354925299005115
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1036.3,
"completions/max_terminated_length": 911.4,
"completions/mean_length": 160.23359375,
"completions/mean_terminated_length": 153.60381622314452,
"completions/min_length": 66.3,
"completions/min_terminated_length": 66.3,
"entropy": 0.03635999157559126,
"epoch": 36.74518201284796,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.431640625,
"learning_rate": 8.284100000000001e-06,
"loss": -0.0068,
"num_tokens": 1665959158.0,
"reward": 1.0853125214576722,
"reward_std": 0.09340935200452805,
"rewards/reward_accuracy/mean": 0.985546875,
"rewards/reward_accuracy/std": 0.0920293740928173,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0020548264496028424,
"sampling/importance_sampling_ratio/max": 2.408253288269043,
"sampling/importance_sampling_ratio/mean": 0.9886627435684204,
"sampling/importance_sampling_ratio/min": 0.09710734933614731,
"sampling/sampling_logp_difference/max": 1.1360019326210022,
"sampling/sampling_logp_difference/mean": 0.003796965954825282,
"step": 17160,
"step_time": 5.317850829297095
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1234.5,
"completions/max_terminated_length": 1100.8,
"completions/mean_length": 152.606640625,
"completions/mean_terminated_length": 148.92791595458985,
"completions/min_length": 70.9,
"completions/min_terminated_length": 70.9,
"entropy": 0.03638518955558538,
"epoch": 36.76659528907923,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.2831e-06,
"loss": -0.004,
"num_tokens": 1666875175.0,
"reward": 1.0822656393051147,
"reward_std": 0.1051513247191906,
"rewards/reward_accuracy/mean": 0.982421875,
"rewards/reward_accuracy/std": 0.10399180352687835,
"rewards/reward_format/mean": 0.09984375089406967,
"rewards/reward_format/std": 0.0020762487081810834,
"sampling/importance_sampling_ratio/max": 2.504425573348999,
"sampling/importance_sampling_ratio/mean": 0.9960906565189361,
"sampling/importance_sampling_ratio/min": 0.11315562576055527,
"sampling/sampling_logp_difference/max": 1.1569079756736755,
"sampling/sampling_logp_difference/mean": 0.0036108621396124365,
"step": 17170,
"step_time": 5.99232812669361
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 1051.4,
"completions/max_terminated_length": 890.2,
"completions/mean_length": 151.198046875,
"completions/mean_terminated_length": 144.56801147460936,
"completions/min_length": 58.9,
"completions/min_terminated_length": 58.9,
"entropy": 0.036883511627092955,
"epoch": 36.78800856531049,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.26171875,
"learning_rate": 8.2821e-06,
"loss": 0.0019,
"num_tokens": 1667780290.0,
"reward": 1.069238305091858,
"reward_std": 0.1370521105825901,
"rewards/reward_accuracy/mean": 0.96953125,
"rewards/reward_accuracy/std": 0.13577400296926498,
"rewards/reward_format/mean": 0.09970703274011612,
"rewards/reward_format/std": 0.002786072762683034,
"sampling/importance_sampling_ratio/max": 2.5396765232086183,
"sampling/importance_sampling_ratio/mean": 0.9771266996860504,
"sampling/importance_sampling_ratio/min": 0.10917413458228112,
"sampling/sampling_logp_difference/max": 1.156593918800354,
"sampling/sampling_logp_difference/mean": 0.0037082911003381014,
"step": 17180,
"step_time": 5.166250075984863
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1666.7,
"completions/max_terminated_length": 1254.4,
"completions/mean_length": 155.24375,
"completions/mean_terminated_length": 147.87504959106445,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.03854782555717975,
"epoch": 36.809421841541756,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.281100000000001e-06,
"loss": -0.0053,
"num_tokens": 1668703378.0,
"reward": 1.0617578148841857,
"reward_std": 0.15766861587762832,
"rewards/reward_accuracy/mean": 0.962109375,
"rewards/reward_accuracy/std": 0.15634576976299286,
"rewards/reward_format/mean": 0.09964843764901161,
"rewards/reward_format/std": 0.0033908478450030088,
"sampling/importance_sampling_ratio/max": 2.840210485458374,
"sampling/importance_sampling_ratio/mean": 0.9858028411865234,
"sampling/importance_sampling_ratio/min": 0.1194460573606193,
"sampling/sampling_logp_difference/max": 1.0993701815605164,
"sampling/sampling_logp_difference/mean": 0.003979932446964085,
"step": 17190,
"step_time": 7.877680866894662
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1193.6,
"completions/max_terminated_length": 952.3,
"completions/mean_length": 151.4046875,
"completions/mean_terminated_length": 147.7388900756836,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.03759072639513761,
"epoch": 36.83083511777302,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.19140625,
"learning_rate": 8.2801e-06,
"loss": -0.0053,
"num_tokens": 1669606446.0,
"reward": 1.078808605670929,
"reward_std": 0.10807892680168152,
"rewards/reward_accuracy/mean": 0.97890625,
"rewards/reward_accuracy/std": 0.10729465633630753,
"rewards/reward_format/mean": 0.09990234449505805,
"rewards/reward_format/std": 0.0013226743321865797,
"sampling/importance_sampling_ratio/max": 2.4541747093200685,
"sampling/importance_sampling_ratio/mean": 0.9872480928897858,
"sampling/importance_sampling_ratio/min": 0.1161721320822835,
"sampling/sampling_logp_difference/max": 0.9505824565887451,
"sampling/sampling_logp_difference/mean": 0.004012912418693304,
"step": 17200,
"step_time": 5.85424451699073
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 984.0,
"completions/max_terminated_length": 927.0,
"completions/mean_length": 156.620703125,
"completions/mean_terminated_length": 150.13172912597656,
"completions/min_length": 66.5,
"completions/min_terminated_length": 66.5,
"entropy": 0.0374056106666103,
"epoch": 36.852248394004285,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.0,
"learning_rate": 8.279100000000002e-06,
"loss": 0.0028,
"num_tokens": 1670526323.0,
"reward": 1.061035168170929,
"reward_std": 0.1578659877181053,
"rewards/reward_accuracy/mean": 0.961328125,
"rewards/reward_accuracy/std": 0.15637051910161973,
"rewards/reward_format/mean": 0.09970703199505807,
"rewards/reward_format/std": 0.0023872296558693053,
"sampling/importance_sampling_ratio/max": 2.4646922945976257,
"sampling/importance_sampling_ratio/mean": 0.9811775922775269,
"sampling/importance_sampling_ratio/min": 0.15516735129058362,
"sampling/sampling_logp_difference/max": 0.9793354511260987,
"sampling/sampling_logp_difference/mean": 0.003750620409846306,
"step": 17210,
"step_time": 5.031865964300232
},
{
"clip_ratio/high_max": 1.4106271555647254e-05,
"clip_ratio/high_mean": 1.7632839444559067e-06,
"clip_ratio/low_mean": 2.90873233552702e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 4.672016348195029e-06,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 1443.4,
"completions/max_terminated_length": 1180.5,
"completions/mean_length": 180.326953125,
"completions/mean_terminated_length": 156.90660400390624,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.047154431627131996,
"epoch": 36.87366167023555,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.80078125,
"learning_rate": 8.278100000000001e-06,
"loss": -0.0034,
"num_tokens": 1671512920.0,
"reward": 1.0478906393051148,
"reward_std": 0.19146788716316224,
"rewards/reward_accuracy/mean": 0.948828125,
"rewards/reward_accuracy/std": 0.18800097852945327,
"rewards/reward_format/mean": 0.09906250089406968,
"rewards/reward_format/std": 0.006035793689079583,
"sampling/importance_sampling_ratio/max": 2.665428614616394,
"sampling/importance_sampling_ratio/mean": 0.9828044652938843,
"sampling/importance_sampling_ratio/min": 0.10971103087067605,
"sampling/sampling_logp_difference/max": 1.2388720631599426,
"sampling/sampling_logp_difference/mean": 0.004170396272093058,
"step": 17220,
"step_time": 7.43489915910759
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 1719.6,
"completions/max_terminated_length": 1489.9,
"completions/mean_length": 177.556640625,
"completions/mean_terminated_length": 163.00500946044923,
"completions/min_length": 66.5,
"completions/min_terminated_length": 66.5,
"entropy": 0.048309897421859205,
"epoch": 36.895074946466806,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0771484375,
"learning_rate": 8.2771e-06,
"loss": -0.0036,
"num_tokens": 1672482457.0,
"reward": 1.0702343821525573,
"reward_std": 0.13922830000519754,
"rewards/reward_accuracy/mean": 0.970703125,
"rewards/reward_accuracy/std": 0.1373604416847229,
"rewards/reward_format/mean": 0.09953124970197677,
"rewards/reward_format/std": 0.004136061132885516,
"sampling/importance_sampling_ratio/max": 2.56700336933136,
"sampling/importance_sampling_ratio/mean": 0.977234947681427,
"sampling/importance_sampling_ratio/min": 0.07759157493710518,
"sampling/sampling_logp_difference/max": 1.3099196016788484,
"sampling/sampling_logp_difference/mean": 0.004079878586344421,
"step": 17230,
"step_time": 8.644456851901486
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1271.4,
"completions/max_terminated_length": 1227.8,
"completions/mean_length": 158.69140625,
"completions/mean_terminated_length": 152.8680389404297,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.040747201163321735,
"epoch": 36.91648822269807,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.2761e-06,
"loss": -0.0011,
"num_tokens": 1673404291.0,
"reward": 1.0610937595367431,
"reward_std": 0.14532053992152213,
"rewards/reward_accuracy/mean": 0.961328125,
"rewards/reward_accuracy/std": 0.1444932483136654,
"rewards/reward_format/mean": 0.09976562559604644,
"rewards/reward_format/std": 0.0022298872703686357,
"sampling/importance_sampling_ratio/max": 2.4993215918540956,
"sampling/importance_sampling_ratio/mean": 0.9836537599563598,
"sampling/importance_sampling_ratio/min": 0.11817399710416794,
"sampling/sampling_logp_difference/max": 0.9379723846912384,
"sampling/sampling_logp_difference/mean": 0.003884970489889383,
"step": 17240,
"step_time": 6.338061356186517
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 1418.7,
"completions/max_terminated_length": 1095.2,
"completions/mean_length": 164.644140625,
"completions/mean_terminated_length": 156.64005126953126,
"completions/min_length": 65.5,
"completions/min_terminated_length": 65.5,
"entropy": 0.040637789154425265,
"epoch": 36.937901498929335,
"frac_reward_zero_std": 0.91875,
"grad_norm": 1.0078125,
"learning_rate": 8.2751e-06,
"loss": -0.0115,
"num_tokens": 1674343668.0,
"reward": 1.0766992330551148,
"reward_std": 0.12311619967222213,
"rewards/reward_accuracy/mean": 0.976953125,
"rewards/reward_accuracy/std": 0.12183539867401123,
"rewards/reward_format/mean": 0.09974609538912774,
"rewards/reward_format/std": 0.0022761271568015216,
"sampling/importance_sampling_ratio/max": 2.4237672448158265,
"sampling/importance_sampling_ratio/mean": 0.980530071258545,
"sampling/importance_sampling_ratio/min": 0.05507344603538513,
"sampling/sampling_logp_difference/max": 0.9953556776046752,
"sampling/sampling_logp_difference/mean": 0.0038464025361463427,
"step": 17250,
"step_time": 6.902131848593126
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00234375,
"completions/max_length": 1119.8,
"completions/max_terminated_length": 789.1,
"completions/mean_length": 140.31484375,
"completions/mean_terminated_length": 135.86816864013673,
"completions/min_length": 60.7,
"completions/min_terminated_length": 60.7,
"entropy": 0.03148098574019968,
"epoch": 36.9593147751606,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.0,
"learning_rate": 8.274100000000001e-06,
"loss": -0.0042,
"num_tokens": 1675214986.0,
"reward": 1.0791406452655792,
"reward_std": 0.08320600986480713,
"rewards/reward_accuracy/mean": 0.979296875,
"rewards/reward_accuracy/std": 0.08258519321680069,
"rewards/reward_format/mean": 0.09984375089406967,
"rewards/reward_format/std": 0.0017032783478498458,
"sampling/importance_sampling_ratio/max": 2.4325836896896362,
"sampling/importance_sampling_ratio/mean": 0.9992759466171265,
"sampling/importance_sampling_ratio/min": 0.215669996291399,
"sampling/sampling_logp_difference/max": 1.0062005281448365,
"sampling/sampling_logp_difference/mean": 0.0033112884499132632,
"step": 17260,
"step_time": 5.571213839593111
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003515625,
"completions/max_length": 861.2,
"completions/max_terminated_length": 641.3,
"completions/mean_length": 141.296484375,
"completions/mean_terminated_length": 134.79827423095702,
"completions/min_length": 62.7,
"completions/min_terminated_length": 62.7,
"entropy": 0.03714139463845641,
"epoch": 36.980728051391864,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.0,
"learning_rate": 8.2731e-06,
"loss": -0.0032,
"num_tokens": 1676089745.0,
"reward": 1.0813281416893006,
"reward_std": 0.07227774858474731,
"rewards/reward_accuracy/mean": 0.981640625,
"rewards/reward_accuracy/std": 0.07095524892210961,
"rewards/reward_format/mean": 0.09968750104308129,
"rewards/reward_format/std": 0.0026304484345018864,
"sampling/importance_sampling_ratio/max": 2.4219041228294373,
"sampling/importance_sampling_ratio/mean": 0.984196150302887,
"sampling/importance_sampling_ratio/min": 0.12312453836202622,
"sampling/sampling_logp_difference/max": 1.1365147829055786,
"sampling/sampling_logp_difference/mean": 0.003861013241112232,
"step": 17270,
"step_time": 4.636676445280318
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 1151.8,
"completions/max_terminated_length": 1136.2,
"completions/mean_length": 153.9125,
"completions/mean_terminated_length": 153.18356018066407,
"completions/min_length": 66.3,
"completions/min_terminated_length": 66.3,
"entropy": 0.03614345300011337,
"epoch": 37.00214132762313,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.0,
"learning_rate": 8.2721e-06,
"loss": 0.0028,
"num_tokens": 1677003377.0,
"reward": 1.0651562690734864,
"reward_std": 0.13089523762464522,
"rewards/reward_accuracy/mean": 0.965234375,
"rewards/reward_accuracy/std": 0.13057180047035216,
"rewards/reward_format/mean": 0.09992187619209289,
"rewards/reward_format/std": 0.001010174280963838,
"sampling/importance_sampling_ratio/max": 2.5275142908096315,
"sampling/importance_sampling_ratio/mean": 0.9900073766708374,
"sampling/importance_sampling_ratio/min": 0.11295253373682498,
"sampling/sampling_logp_difference/max": 1.2977279722690582,
"sampling/sampling_logp_difference/mean": 0.0036860945634543895,
"step": 17280,
"step_time": 5.823213632291299
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.000390625,
"completions/max_length": 746.2,
"completions/max_terminated_length": 636.4,
"completions/mean_length": 138.325,
"completions/mean_terminated_length": 137.5866912841797,
"completions/min_length": 63.6,
"completions/min_terminated_length": 63.6,
"entropy": 0.030357306986115874,
"epoch": 37.02355460385439,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.1982421875,
"learning_rate": 8.271100000000001e-06,
"loss": -0.0052,
"num_tokens": 1677877361.0,
"reward": 1.097265648841858,
"reward_std": 0.03639297336339951,
"rewards/reward_accuracy/mean": 0.997265625,
"rewards/reward_accuracy/std": 0.03639297336339951,
"rewards/reward_format/mean": 0.10000000149011612,
"rewards/reward_format/std": 0.0,
"sampling/importance_sampling_ratio/max": 2.509897768497467,
"sampling/importance_sampling_ratio/mean": 0.996073055267334,
"sampling/importance_sampling_ratio/min": 0.22899780459702015,
"sampling/sampling_logp_difference/max": 0.9582019150257111,
"sampling/sampling_logp_difference/mean": 0.00335601232945919,
"step": 17290,
"step_time": 3.7673478122800588
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1014.9,
"completions/max_terminated_length": 838.7,
"completions/mean_length": 139.997265625,
"completions/mean_terminated_length": 137.75748977661132,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.03179299151524902,
"epoch": 37.04496788008565,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.2236328125,
"learning_rate": 8.2701e-06,
"loss": 0.0004,
"num_tokens": 1678748778.0,
"reward": 1.0772265791893005,
"reward_std": 0.0981633186340332,
"rewards/reward_accuracy/mean": 0.97734375,
"rewards/reward_accuracy/std": 0.09687739014625549,
"rewards/reward_format/mean": 0.09988281354308129,
"rewards/reward_format/std": 0.0016351743834093213,
"sampling/importance_sampling_ratio/max": 2.4220149517059326,
"sampling/importance_sampling_ratio/mean": 0.9937459766864777,
"sampling/importance_sampling_ratio/min": 0.185369835793972,
"sampling/sampling_logp_difference/max": 1.0076110303401946,
"sampling/sampling_logp_difference/mean": 0.003556184773333371,
"step": 17300,
"step_time": 5.056093368888833
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 705.3,
"completions/max_terminated_length": 670.9,
"completions/mean_length": 141.319921875,
"completions/mean_terminated_length": 139.87212371826172,
"completions/min_length": 62.9,
"completions/min_terminated_length": 62.9,
"entropy": 0.03514936645515263,
"epoch": 37.066381156316915,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.7421875,
"learning_rate": 8.269100000000002e-06,
"loss": 0.0003,
"num_tokens": 1679623373.0,
"reward": 1.089414083957672,
"reward_std": 0.07415991947054863,
"rewards/reward_accuracy/mean": 0.989453125,
"rewards/reward_accuracy/std": 0.07400080561637878,
"rewards/reward_format/mean": 0.0999609388411045,
"rewards/reward_format/std": 0.0006250000558793544,
"sampling/importance_sampling_ratio/max": 2.5152835488319396,
"sampling/importance_sampling_ratio/mean": 0.9841496109962463,
"sampling/importance_sampling_ratio/min": 0.12821442484855652,
"sampling/sampling_logp_difference/max": 1.414483892917633,
"sampling/sampling_logp_difference/mean": 0.003964057238772511,
"step": 17310,
"step_time": 3.8009893837966957
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1301.0,
"completions/max_terminated_length": 891.7,
"completions/mean_length": 140.53203125,
"completions/mean_terminated_length": 136.80176391601563,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.03382158984895796,
"epoch": 37.08779443254818,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.1044921875,
"learning_rate": 8.268100000000001e-06,
"loss": -0.0015,
"num_tokens": 1680502047.0,
"reward": 1.0865625262260437,
"reward_std": 0.08080676272511482,
"rewards/reward_accuracy/mean": 0.98671875,
"rewards/reward_accuracy/std": 0.07883507385849953,
"rewards/reward_format/mean": 0.09984375163912773,
"rewards/reward_format/std": 0.0020129600539803504,
"sampling/importance_sampling_ratio/max": 2.5258668422698975,
"sampling/importance_sampling_ratio/mean": 0.990731418132782,
"sampling/importance_sampling_ratio/min": 0.19932899624109268,
"sampling/sampling_logp_difference/max": 0.9734511852264405,
"sampling/sampling_logp_difference/mean": 0.0037323614582419396,
"step": 17320,
"step_time": 6.119291465706192
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1086.5,
"completions/max_terminated_length": 968.2,
"completions/mean_length": 149.821484375,
"completions/mean_terminated_length": 140.26180419921874,
"completions/min_length": 65.7,
"completions/min_terminated_length": 65.7,
"entropy": 0.03720725756138563,
"epoch": 37.109207708779444,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.40625,
"learning_rate": 8.267100000000001e-06,
"loss": -0.0066,
"num_tokens": 1681403734.0,
"reward": 1.0714258015155793,
"reward_std": 0.11854810193181038,
"rewards/reward_accuracy/mean": 0.971875,
"rewards/reward_accuracy/std": 0.11656470969319344,
"rewards/reward_format/mean": 0.0995507813990116,
"rewards/reward_format/std": 0.003493543271906674,
"sampling/importance_sampling_ratio/max": 2.411083149909973,
"sampling/importance_sampling_ratio/mean": 0.9989332795143128,
"sampling/importance_sampling_ratio/min": 0.10096452236175538,
"sampling/sampling_logp_difference/max": 0.8836498200893402,
"sampling/sampling_logp_difference/mean": 0.003796548000536859,
"step": 17330,
"step_time": 5.608761514499202
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1430.6,
"completions/max_terminated_length": 1093.2,
"completions/mean_length": 170.737109375,
"completions/mean_terminated_length": 153.1694763183594,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.04225459115114063,
"epoch": 37.13062098501071,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.2353515625,
"learning_rate": 8.2661e-06,
"loss": -0.0068,
"num_tokens": 1682358901.0,
"reward": 1.0575390875339508,
"reward_std": 0.17237160727381706,
"rewards/reward_accuracy/mean": 0.958203125,
"rewards/reward_accuracy/std": 0.16974786669015884,
"rewards/reward_format/mean": 0.09933593794703484,
"rewards/reward_format/std": 0.004886298021301627,
"sampling/importance_sampling_ratio/max": 2.596054196357727,
"sampling/importance_sampling_ratio/mean": 0.978290218114853,
"sampling/importance_sampling_ratio/min": 0.06933320630341769,
"sampling/sampling_logp_difference/max": 1.262159913778305,
"sampling/sampling_logp_difference/mean": 0.003913385770283639,
"step": 17340,
"step_time": 7.194087419201969
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0015625,
"completions/max_length": 937.3,
"completions/max_terminated_length": 805.3,
"completions/mean_length": 147.615625,
"completions/mean_terminated_length": 144.6868637084961,
"completions/min_length": 62.3,
"completions/min_terminated_length": 62.3,
"entropy": 0.03330528517253697,
"epoch": 37.15203426124197,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.1044921875,
"learning_rate": 8.2651e-06,
"loss": -0.0032,
"num_tokens": 1683258973.0,
"reward": 1.0827539205551147,
"reward_std": 0.0778868566500023,
"rewards/reward_accuracy/mean": 0.9828125,
"rewards/reward_accuracy/std": 0.07743302211165429,
"rewards/reward_format/mean": 0.09994140714406967,
"rewards/reward_format/std": 0.0009375000605359674,
"sampling/importance_sampling_ratio/max": 2.379735863208771,
"sampling/importance_sampling_ratio/mean": 0.9887044966220856,
"sampling/importance_sampling_ratio/min": 0.1595401745289564,
"sampling/sampling_logp_difference/max": 0.8792152345180512,
"sampling/sampling_logp_difference/mean": 0.0034371944377198814,
"step": 17350,
"step_time": 4.7954618477146145
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1105.5,
"completions/max_terminated_length": 1043.6,
"completions/mean_length": 146.717578125,
"completions/mean_terminated_length": 143.02025146484374,
"completions/min_length": 66.1,
"completions/min_terminated_length": 66.1,
"entropy": 0.036494726710952816,
"epoch": 37.17344753747324,
"frac_reward_zero_std": 0.94375,
"grad_norm": 0.0,
"learning_rate": 8.264100000000001e-06,
"loss": -0.0033,
"num_tokens": 1684145690.0,
"reward": 1.0611718893051147,
"reward_std": 0.11920133978128433,
"rewards/reward_accuracy/mean": 0.961328125,
"rewards/reward_accuracy/std": 0.1188714049756527,
"rewards/reward_format/mean": 0.09984375014901162,
"rewards/reward_format/std": 0.0018717264058068395,
"sampling/importance_sampling_ratio/max": 2.7716023921966553,
"sampling/importance_sampling_ratio/mean": 0.9912648856639862,
"sampling/importance_sampling_ratio/min": 0.15025479197502137,
"sampling/sampling_logp_difference/max": 0.9307545781135559,
"sampling/sampling_logp_difference/mean": 0.0039615572663024064,
"step": 17360,
"step_time": 5.348896937427344
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1567.1,
"completions/max_terminated_length": 1311.4,
"completions/mean_length": 168.471484375,
"completions/mean_terminated_length": 156.12876586914064,
"completions/min_length": 62.9,
"completions/min_terminated_length": 62.9,
"entropy": 0.041598477470688525,
"epoch": 37.194860813704494,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.2631e-06,
"loss": -0.0091,
"num_tokens": 1685096913.0,
"reward": 1.0536718845367432,
"reward_std": 0.15800219923257827,
"rewards/reward_accuracy/mean": 0.954296875,
"rewards/reward_accuracy/std": 0.15505429729819298,
"rewards/reward_format/mean": 0.09937500059604645,
"rewards/reward_format/std": 0.0056624005548655985,
"sampling/importance_sampling_ratio/max": 2.4480199813842773,
"sampling/importance_sampling_ratio/mean": 0.9819984376430512,
"sampling/importance_sampling_ratio/min": 0.07902534604072571,
"sampling/sampling_logp_difference/max": 0.9924896240234375,
"sampling/sampling_logp_difference/mean": 0.004058981174603104,
"step": 17370,
"step_time": 7.38133968768525
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 817.8,
"completions/max_terminated_length": 817.8,
"completions/mean_length": 138.514453125,
"completions/mean_terminated_length": 138.514453125,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.030976234935224056,
"epoch": 37.21627408993576,
"frac_reward_zero_std": 0.98125,
"grad_norm": 0.0,
"learning_rate": 8.2621e-06,
"loss": -0.0023,
"num_tokens": 1685966934.0,
"reward": 1.0675781488418579,
"reward_std": 0.12096884772181511,
"rewards/reward_accuracy/mean": 0.967578125,
"rewards/reward_accuracy/std": 0.12096885219216347,
"rewards/reward_format/mean": 0.10000000149011612,
"rewards/reward_format/std": 0.0,
"sampling/importance_sampling_ratio/max": 2.433612644672394,
"sampling/importance_sampling_ratio/mean": 0.9841935634613037,
"sampling/importance_sampling_ratio/min": 0.1833546683192253,
"sampling/sampling_logp_difference/max": 1.1916334271430968,
"sampling/sampling_logp_difference/mean": 0.003613804467022419,
"step": 17380,
"step_time": 4.226271302686655
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009375,
"completions/max_length": 1228.4,
"completions/max_terminated_length": 802.4,
"completions/mean_length": 165.961328125,
"completions/mean_terminated_length": 148.51888122558594,
"completions/min_length": 65.6,
"completions/min_terminated_length": 65.6,
"entropy": 0.04037524042651057,
"epoch": 37.23768736616702,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.6171875,
"learning_rate": 8.261100000000001e-06,
"loss": -0.0018,
"num_tokens": 1686917123.0,
"reward": 1.064550805091858,
"reward_std": 0.11567025035619735,
"rewards/reward_accuracy/mean": 0.965234375,
"rewards/reward_accuracy/std": 0.11387608796358109,
"rewards/reward_format/mean": 0.09931640774011612,
"rewards/reward_format/std": 0.0031230305321514606,
"sampling/importance_sampling_ratio/max": 2.321583294868469,
"sampling/importance_sampling_ratio/mean": 0.9823273241519928,
"sampling/importance_sampling_ratio/min": 0.1251470696181059,
"sampling/sampling_logp_difference/max": 0.9099372506141663,
"sampling/sampling_logp_difference/mean": 0.0038255035178735852,
"step": 17390,
"step_time": 6.015936276898719
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1308.9,
"completions/max_terminated_length": 1036.0,
"completions/mean_length": 154.394140625,
"completions/mean_terminated_length": 147.04397583007812,
"completions/min_length": 62.0,
"completions/min_terminated_length": 62.0,
"entropy": 0.03981123950798064,
"epoch": 37.25910064239829,
"frac_reward_zero_std": 0.90625,
"grad_norm": 1.15625,
"learning_rate": 8.2601e-06,
"loss": -0.0015,
"num_tokens": 1687826996.0,
"reward": 1.0606445670127869,
"reward_std": 0.14741346165537833,
"rewards/reward_accuracy/mean": 0.9609375,
"rewards/reward_accuracy/std": 0.14632000923156738,
"rewards/reward_format/mean": 0.09970703348517418,
"rewards/reward_format/std": 0.0025575154460966585,
"sampling/importance_sampling_ratio/max": 2.387849545478821,
"sampling/importance_sampling_ratio/mean": 0.9930152714252471,
"sampling/importance_sampling_ratio/min": 0.12419379390776157,
"sampling/sampling_logp_difference/max": 0.9156295776367187,
"sampling/sampling_logp_difference/mean": 0.003882711986079812,
"step": 17400,
"step_time": 6.336218408102286
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 862.3,
"completions/max_terminated_length": 851.2,
"completions/mean_length": 147.939453125,
"completions/mean_terminated_length": 142.84150238037108,
"completions/min_length": 64.3,
"completions/min_terminated_length": 64.3,
"entropy": 0.03462249604053795,
"epoch": 37.28051391862955,
"frac_reward_zero_std": 0.925,
"grad_norm": 1.140625,
"learning_rate": 8.2591e-06,
"loss": -0.0052,
"num_tokens": 1688723033.0,
"reward": 1.0755468964576722,
"reward_std": 0.11447896733880043,
"rewards/reward_accuracy/mean": 0.97578125,
"rewards/reward_accuracy/std": 0.1134743221104145,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.0020614393055438996,
"sampling/importance_sampling_ratio/max": 2.5567697286605835,
"sampling/importance_sampling_ratio/mean": 0.9814333319664001,
"sampling/importance_sampling_ratio/min": 0.20567349940538407,
"sampling/sampling_logp_difference/max": 1.003773581981659,
"sampling/sampling_logp_difference/mean": 0.0038596568629145622,
"step": 17410,
"step_time": 4.611153523795656
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 957.0,
"completions/max_terminated_length": 889.1,
"completions/mean_length": 149.618359375,
"completions/mean_terminated_length": 145.9659896850586,
"completions/min_length": 63.7,
"completions/min_terminated_length": 63.7,
"entropy": 0.03954408566933125,
"epoch": 37.301927194860816,
"frac_reward_zero_std": 0.96875,
"grad_norm": 0.0,
"learning_rate": 8.258100000000001e-06,
"loss": -0.0029,
"num_tokens": 1689620728.0,
"reward": 1.0775586187839508,
"reward_std": 0.08190464451909066,
"rewards/reward_accuracy/mean": 0.977734375,
"rewards/reward_accuracy/std": 0.08110087737441063,
"rewards/reward_format/mean": 0.09982422068715095,
"rewards/reward_format/std": 0.00208563432097435,
"sampling/importance_sampling_ratio/max": 2.5637996196746826,
"sampling/importance_sampling_ratio/mean": 0.9856291949748993,
"sampling/importance_sampling_ratio/min": 0.152293062210083,
"sampling/sampling_logp_difference/max": 0.9705824851989746,
"sampling/sampling_logp_difference/mean": 0.004004375613294542,
"step": 17420,
"step_time": 4.9714009387942495
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1350.7,
"completions/max_terminated_length": 991.4,
"completions/mean_length": 156.005859375,
"completions/mean_terminated_length": 152.30741271972656,
"completions/min_length": 65.4,
"completions/min_terminated_length": 65.4,
"entropy": 0.03667991873808205,
"epoch": 37.323340471092074,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.2470703125,
"learning_rate": 8.257100000000001e-06,
"loss": -0.0056,
"num_tokens": 1690542759.0,
"reward": 1.0662695288658142,
"reward_std": 0.13849776312708856,
"rewards/reward_accuracy/mean": 0.96640625,
"rewards/reward_accuracy/std": 0.1376886285841465,
"rewards/reward_format/mean": 0.09986328110098838,
"rewards/reward_format/std": 0.0021875001257285476,
"sampling/importance_sampling_ratio/max": 2.5367436170578004,
"sampling/importance_sampling_ratio/mean": 0.9897383630275727,
"sampling/importance_sampling_ratio/min": 0.11700916104018688,
"sampling/sampling_logp_difference/max": 1.009674859046936,
"sampling/sampling_logp_difference/mean": 0.0038382849190384148,
"step": 17430,
"step_time": 6.29731653239578
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 772.7,
"completions/max_terminated_length": 772.7,
"completions/mean_length": 133.567578125,
"completions/mean_terminated_length": 133.567578125,
"completions/min_length": 69.4,
"completions/min_terminated_length": 69.4,
"entropy": 0.030218291003257035,
"epoch": 37.34475374732334,
"frac_reward_zero_std": 0.96875,
"grad_norm": 0.0,
"learning_rate": 8.2561e-06,
"loss": 0.0016,
"num_tokens": 1691398756.0,
"reward": 1.091406273841858,
"reward_std": 0.054396535456180575,
"rewards/reward_accuracy/mean": 0.99140625,
"rewards/reward_accuracy/std": 0.05439653694629669,
"rewards/reward_format/mean": 0.10000000149011612,
"rewards/reward_format/std": 0.0,
"sampling/importance_sampling_ratio/max": 2.456720006465912,
"sampling/importance_sampling_ratio/mean": 0.9965405285358429,
"sampling/importance_sampling_ratio/min": 0.22018914222717284,
"sampling/sampling_logp_difference/max": 0.8601956069469452,
"sampling/sampling_logp_difference/mean": 0.003531132242642343,
"step": 17440,
"step_time": 4.020725980988937
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.003125,
"completions/max_length": 1082.4,
"completions/max_terminated_length": 1025.4,
"completions/mean_length": 160.57734375,
"completions/mean_terminated_length": 154.73056335449218,
"completions/min_length": 63.3,
"completions/min_terminated_length": 63.3,
"entropy": 0.043271939759142695,
"epoch": 37.3661670235546,
"frac_reward_zero_std": 0.95,
"grad_norm": 0.265625,
"learning_rate": 8.2551e-06,
"loss": 0.0001,
"num_tokens": 1692327946.0,
"reward": 1.073984396457672,
"reward_std": 0.11353397518396377,
"rewards/reward_accuracy/mean": 0.97421875,
"rewards/reward_accuracy/std": 0.1127819374203682,
"rewards/reward_format/mean": 0.0997656263411045,
"rewards/reward_format/std": 0.002156556583940983,
"sampling/importance_sampling_ratio/max": 2.5148208379745483,
"sampling/importance_sampling_ratio/mean": 0.9863678038120269,
"sampling/importance_sampling_ratio/min": 0.08524537284392864,
"sampling/sampling_logp_difference/max": 1.0103930830955505,
"sampling/sampling_logp_difference/mean": 0.004005987802520395,
"step": 17450,
"step_time": 5.583142573508667
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00546875,
"completions/max_length": 1140.7,
"completions/max_terminated_length": 1096.9,
"completions/mean_length": 161.547265625,
"completions/mean_terminated_length": 151.30254211425782,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.04085614494979382,
"epoch": 37.38758029978587,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.0,
"learning_rate": 8.254100000000001e-06,
"loss": -0.0047,
"num_tokens": 1693260371.0,
"reward": 1.0750195622444152,
"reward_std": 0.11686961352825165,
"rewards/reward_accuracy/mean": 0.975390625,
"rewards/reward_accuracy/std": 0.11521074995398521,
"rewards/reward_format/mean": 0.09962890818715095,
"rewards/reward_format/std": 0.003144233766943216,
"sampling/importance_sampling_ratio/max": 2.3925825119018556,
"sampling/importance_sampling_ratio/mean": 0.9905248939990997,
"sampling/importance_sampling_ratio/min": 0.18846278823912144,
"sampling/sampling_logp_difference/max": 0.9754943192005158,
"sampling/sampling_logp_difference/mean": 0.0038275557104498147,
"step": 17460,
"step_time": 5.776656303388881
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.006640625,
"completions/max_length": 1745.2,
"completions/max_terminated_length": 1485.6,
"completions/mean_length": 173.705859375,
"completions/mean_terminated_length": 161.40840759277344,
"completions/min_length": 63.8,
"completions/min_terminated_length": 63.8,
"entropy": 0.044704304356127975,
"epoch": 37.40899357601713,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.123046875,
"learning_rate": 8.2531e-06,
"loss": -0.0043,
"num_tokens": 1694226594.0,
"reward": 1.048613291978836,
"reward_std": 0.1858178623020649,
"rewards/reward_accuracy/mean": 0.94921875,
"rewards/reward_accuracy/std": 0.1832251287996769,
"rewards/reward_format/mean": 0.09939453154802322,
"rewards/reward_format/std": 0.004686146159656346,
"sampling/importance_sampling_ratio/max": 2.411776542663574,
"sampling/importance_sampling_ratio/mean": 0.9825144350528717,
"sampling/importance_sampling_ratio/min": 0.08649432472884655,
"sampling/sampling_logp_difference/max": 0.9522940516471863,
"sampling/sampling_logp_difference/mean": 0.00417980900965631,
"step": 17470,
"step_time": 8.23940601379727
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 1542.5,
"completions/max_terminated_length": 1270.4,
"completions/mean_length": 172.70390625,
"completions/mean_terminated_length": 163.94646530151368,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.04375751700717956,
"epoch": 37.430406852248396,
"frac_reward_zero_std": 0.9125,
"grad_norm": 0.173828125,
"learning_rate": 8.2521e-06,
"loss": -0.0062,
"num_tokens": 1695188972.0,
"reward": 1.0526172041893005,
"reward_std": 0.1693673207424581,
"rewards/reward_accuracy/mean": 0.953125,
"rewards/reward_accuracy/std": 0.16635413765907286,
"rewards/reward_format/mean": 0.09949218854308128,
"rewards/reward_format/std": 0.0045461358269676564,
"sampling/importance_sampling_ratio/max": 2.6265961170196532,
"sampling/importance_sampling_ratio/mean": 0.9898793578147889,
"sampling/importance_sampling_ratio/min": 0.0781846821308136,
"sampling/sampling_logp_difference/max": 1.0049745678901671,
"sampling/sampling_logp_difference/mean": 0.004069277993403375,
"step": 17480,
"step_time": 7.360269370593596
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1267.6,
"completions/max_terminated_length": 1045.8,
"completions/mean_length": 155.2640625,
"completions/mean_terminated_length": 145.67872161865233,
"completions/min_length": 65.9,
"completions/min_terminated_length": 65.9,
"entropy": 0.03696892904117703,
"epoch": 37.45182012847966,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.251100000000001e-06,
"loss": -0.0088,
"num_tokens": 1696094416.0,
"reward": 1.0741601586341858,
"reward_std": 0.11568283960223198,
"rewards/reward_accuracy/mean": 0.974609375,
"rewards/reward_accuracy/std": 0.113650643825531,
"rewards/reward_format/mean": 0.09955078214406968,
"rewards/reward_format/std": 0.003731536399573088,
"sampling/importance_sampling_ratio/max": 2.389391827583313,
"sampling/importance_sampling_ratio/mean": 0.9826786935329437,
"sampling/importance_sampling_ratio/min": 0.19807718452066184,
"sampling/sampling_logp_difference/max": 0.8988526225090027,
"sampling/sampling_logp_difference/mean": 0.003683896572329104,
"step": 17490,
"step_time": 6.293514880212024
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.004296875,
"completions/max_length": 913.1,
"completions/max_terminated_length": 774.2,
"completions/mean_length": 151.145703125,
"completions/mean_terminated_length": 143.0267349243164,
"completions/min_length": 70.9,
"completions/min_terminated_length": 70.9,
"entropy": 0.03303384769242257,
"epoch": 37.47323340471092,
"frac_reward_zero_std": 0.95625,
"grad_norm": 0.28515625,
"learning_rate": 8.250100000000001e-06,
"loss": -0.0018,
"num_tokens": 1696998037.0,
"reward": 1.066757822036743,
"reward_std": 0.13870265260338782,
"rewards/reward_accuracy/mean": 0.9671875,
"rewards/reward_accuracy/std": 0.137006626278162,
"rewards/reward_format/mean": 0.09957031309604644,
"rewards/reward_format/std": 0.0028216129168868063,
"sampling/importance_sampling_ratio/max": 2.330753207206726,
"sampling/importance_sampling_ratio/mean": 0.9832845330238342,
"sampling/importance_sampling_ratio/min": 0.18103825822472572,
"sampling/sampling_logp_difference/max": 1.035352236032486,
"sampling/sampling_logp_difference/mean": 0.003559652413241565,
"step": 17500,
"step_time": 4.802231338585261
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 1380.3,
"completions/max_terminated_length": 1019.9,
"completions/mean_length": 151.68984375,
"completions/mean_terminated_length": 144.25616760253905,
"completions/min_length": 63.9,
"completions/min_terminated_length": 63.9,
"entropy": 0.03658014286775142,
"epoch": 37.49464668094218,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 8.2491e-06,
"loss": -0.0032,
"num_tokens": 1697906859.0,
"reward": 1.071191418170929,
"reward_std": 0.13500199615955352,
"rewards/reward_accuracy/mean": 0.971484375,
"rewards/reward_accuracy/std": 0.13372941613197326,
"rewards/reward_format/mean": 0.09970703199505807,
"rewards/reward_format/std": 0.0024846951011568306,
"sampling/importance_sampling_ratio/max": 2.360874152183533,
"sampling/importance_sampling_ratio/mean": 0.9854281425476075,
"sampling/importance_sampling_ratio/min": 0.08581760674715042,
"sampling/sampling_logp_difference/max": 1.0961284399032594,
"sampling/sampling_logp_difference/mean": 0.0038287627510726454,
"step": 17510,
"step_time": 6.6807689187931825
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 934.8,
"completions/max_terminated_length": 889.2,
"completions/mean_length": 150.673046875,
"completions/mean_terminated_length": 147.07848052978517,
"completions/min_length": 66.8,
"completions/min_terminated_length": 66.8,
"entropy": 0.03802572509739548,
"epoch": 37.51605995717345,
"frac_reward_zero_std": 0.91875,
"grad_norm": 0.0,
"learning_rate": 8.248100000000002e-06,
"loss": -0.0033,
"num_tokens": 1698813574.0,
"reward": 1.0568164229393004,
"reward_std": 0.1656462624669075,
"rewards/reward_accuracy/mean": 0.95703125,
"rewards/reward_accuracy/std": 0.164727533608675,
"rewards/reward_format/mean": 0.09978515729308128,
"rewards/reward_format/std": 0.0018966724630445242,
"sampling/importance_sampling_ratio/max": 2.4545597314834593,
"sampling/importance_sampling_ratio/mean": 0.9896303713321686,
"sampling/importance_sampling_ratio/min": 0.04679772462695837,
"sampling/sampling_logp_difference/max": 1.1055543422698975,
"sampling/sampling_logp_difference/mean": 0.00386879553552717,
"step": 17520,
"step_time": 4.8572828588919945
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 1325.1,
"completions/max_terminated_length": 1153.3,
"completions/mean_length": 167.9421875,
"completions/mean_terminated_length": 156.98287658691407,
"completions/min_length": 66.4,
"completions/min_terminated_length": 66.4,
"entropy": 0.04068209687247872,
"epoch": 37.53747323340471,
"frac_reward_zero_std": 0.90625,
"grad_norm": 0.0,
"learning_rate": 8.247100000000001e-06,
"loss": -0.0046,
"num_tokens": 1699764290.0,
"reward": 1.0597461104393004,
"reward_std": 0.17782938331365586,
"rewards/reward_accuracy/mean": 0.96015625,
"rewards/reward_accuracy/std": 0.17635978162288665,
"rewards/reward_format/mean": 0.09958984479308128,
"rewards/reward_format/std": 0.0031949690310284495,
"sampling/importance_sampling_ratio/max": 2.3542831540107727,
"sampling/importance_sampling_ratio/mean": 0.9782058119773864,
"sampling/importance_sampling_ratio/min": 0.09411680772900581,
"sampling/sampling_logp_difference/max": 1.05520042181015,
"sampling/sampling_logp_difference/mean": 0.00391911652404815,
"step": 17530,
"step_time": 6.489827591009089
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005078125,
"completions/max_length": 1625.1,
"completions/max_terminated_length": 1273.7,
"completions/mean_length": 161.75625,
"completions/mean_terminated_length": 152.15740356445312,
"completions/min_length": 67.3,
"completions/min_terminated_length": 67.3,
"entropy": 0.04201799901202321,
"epoch": 37.558886509635975,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.2461e-06,
"loss": -0.0085,
"num_tokens": 1700699570.0,
"reward": 1.0594336152076722,
"reward_std": 0.16968340128660203,
"rewards/reward_accuracy/mean": 0.959765625,
"rewards/reward_accuracy/std": 0.16839173138141633,
"rewards/reward_format/mean": 0.09966797009110451,
"rewards/reward_format/std": 0.0035196534357964993,
"sampling/importance_sampling_ratio/max": 2.5293297171592712,
"sampling/importance_sampling_ratio/mean": 0.9793931126594544,
"sampling/importance_sampling_ratio/min": 0.02397715747356415,
"sampling/sampling_logp_difference/max": 1.0145317256450652,
"sampling/sampling_logp_difference/mean": 0.004261690657585859,
"step": 17540,
"step_time": 8.042706457703025
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.002734375,
"completions/max_length": 1265.4,
"completions/max_terminated_length": 792.5,
"completions/mean_length": 158.54375,
"completions/mean_terminated_length": 153.37235794067382,
"completions/min_length": 64.8,
"completions/min_terminated_length": 64.8,
"entropy": 0.038389927614480256,
"epoch": 37.58029978586724,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 8.2451e-06,
"loss": -0.006,
"num_tokens": 1701624290.0,
"reward": 1.0743359684944154,
"reward_std": 0.11632372885942459,
"rewards/reward_accuracy/mean": 0.974609375,
"rewards/reward_accuracy/std": 0.11417244896292686,
"rewards/reward_format/mean": 0.09972656443715096,
"rewards/reward_format/std": 0.003639297466725111,
"sampling/importance_sampling_ratio/max": 2.6223907709121703,
"sampling/importance_sampling_ratio/mean": 0.9890406727790833,
"sampling/importance_sampling_ratio/min": 0.11325459443032741,
"sampling/sampling_logp_difference/max": 1.0148925185203552,
"sampling/sampling_logp_difference/mean": 0.003962356713600457,
"step": 17550,
"step_time": 6.070903620988247
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 1319.2,
"completions/max_terminated_length": 1118.9,
"completions/mean_length": 161.4671875,
"completions/mean_terminated_length": 157.827490234375,
"completions/min_length": 66.5,
"completions/min_terminated_length": 66.5,
"entropy": 0.03893483632709831,
"epoch": 37.601713062098504,
"frac_reward_zero_std": 0.89375,
"grad_norm": 0.224609375,
"learning_rate": 8.244100000000001e-06,
"loss": -0.0081,
"num_tokens": 1702565838.0,
"reward": 1.0740234494209289,
"reward_std": 0.12384951785206795,
"rewards/reward_accuracy/mean": 0.97421875,
"rewards/reward_accuracy/std": 0.12286588475108147,
"rewards/reward_format/mean": 0.09980468824505806,
"rewards/reward_format/std": 0.002517323032952845,
"sampling/importance_sampling_ratio/max": 2.469354033470154,
"sampling/importance_sampling_ratio/mean": 0.9738376438617706,
"sampling/importance_sampling_ratio/min": 0.06739170104265213,
"sampling/sampling_logp_difference/max": 1.0840649127960205,
"sampling/sampling_logp_difference/mean": 0.0038587091723456977,
"step": 17560,
"step_time": 6.451433533296222
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 896.1,
"completions/max_terminated_length": 844.4,
"completions/mean_length": 140.837890625,
"completions/mean_terminated_length": 139.36135864257812,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"entropy": 0.03316546860150993,
"epoch": 37.62312633832976,
"frac_reward_zero_std": 0.975,
"grad_norm": 0.0,
"learning_rate": 8.2431e-06,
"loss": -0.0002,
"num_tokens": 1703445807.0,
"reward": 1.092089867591858,
"reward_std": 0.04188975393772125,
"rewards/reward_accuracy/mean": 0.9921875,
"rewards/reward_accuracy/std": 0.041286345571279526,
"rewards/reward_format/mean": 0.09990234524011612,
"rewards/reward_format/std": 0.0011641392018646001,
"sampling/importance_sampling_ratio/max": 2.2464167952537535,
"sampling/importance_sampling_ratio/mean": 0.9894795656204224,
"sampling/importance_sampling_ratio/min": 0.25715187937021255,
"sampling/sampling_logp_difference/max": 1.0376676797866822,
"sampling/sampling_logp_difference/mean": 0.003511449717916548,
"step": 17570,
"step_time": 4.461859550283407
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001171875,
"completions/max_length": 1272.0,
"completions/max_terminated_length": 1072.6,
"completions/mean_length": 148.921875,
"completions/mean_terminated_length": 146.72902069091796,
"completions/min_length": 66.7,
"completions/min_terminated_length": 66.7,
"entropy": 0.03494768962264061,
"epoch": 37.644539614561026,
"frac_reward_zero_std": 0.9375,
"grad_norm": 0.0,
"learning_rate": 8.2421e-06,
"loss": -0.008,
"num_tokens": 1704350759.0,
"reward": 1.079980492591858,
"reward_std": 0.09155199080705642,
"rewards/reward_accuracy/mean": 0.980078125,
"rewards/reward_accuracy/std": 0.09134184867143631,
"rewards/reward_format/mean": 0.09990234449505805,
"rewards/reward_format/std": 0.0013785743853077293,
"sampling/importance_sampling_ratio/max": 2.512464451789856,
"sampling/importance_sampling_ratio/mean": 0.9961632430553437,
"sampling/importance_sampling_ratio/min": 0.21888627260923385,
"sampling/sampling_logp_difference/max": 0.9454879879951477,
"sampling/sampling_logp_difference/mean": 0.003756726742722094,
"step": 17580,
"step_time": 6.094791550192167
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00078125,
"completions/max_length": 1332.5,
"completions/max_terminated_length": 1235.8,
"completions/mean_length": 147.626953125,
"completions/mean_terminated_length": 146.1437545776367,
"completions/min_length": 63.2,
"completions/min_terminated_length": 63.2,
"entropy": 0.037303766678087415,
"epoch": 37.66595289079229,
"frac_reward_zero_std": 0.93125,
"grad_norm": 0.4765625,
"learning_rate": 8.241100000000001e-06,
"loss": -0.0062,
"num_tokens": 1705247292.0,
"reward": 1.0773046970367433,
"reward_std": 0.11238493174314498,
"rewards/reward_accuracy/mean": 0.97734375,
"rewards/reward_accuracy/std": 0.11213328838348388,
"rewards/reward_format/mean": 0.09996093809604645,
"rewards/reward_format/std": 0.0006250000093132258,
"sampling/importance_sampling_ratio/max": 2.4234738111495973,
"sampling/importance_sampling_ratio/mean": 0.9964311003684998,
"sampling/importance_sampling_ratio/min": 0.208051417209208,
"sampling/sampling_logp_difference/max": 1.028080689907074,
"sampling/sampling_logp_difference/mean": 0.003887193859554827,
"step": 17590,
"step_time": 6.206715631714905
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 2.5220654606528113e-06,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 2.5220654606528113e-06,
"completions/clipped_ratio": 0.0046875,
"completions/max_length": 751.6,
"completions/max_terminated_length": 703.5,
"completions/mean_length": 142.525390625,
"completions/mean_terminated_length": 133.59263916015624,
"completions/min_length": 61.5,
"completions/min_terminated_length": 61.5,
"entropy": 0.03331611452158541,
"epoch": 37.687366167023555,
"frac_reward_zero_std": 0.9625,
"grad_norm": 0.0,
"learning_rate": 8.240100000000001e-06,
"loss": -0.0037,
"num_tokens": 1706128701.0,
"reward": 1.0822265863418579,
"reward_std": 0.08399968072772027,
"rewards/reward_accuracy/mean": 0.982421875,
"rewards/reward_accuracy/std": 0.08317572697997093,
"rewards/reward_format/mean": 0.09980468899011612,
"rewards/reward_format/std": 0.0015914240153506397,
"sampling/importance_sampling_ratio/max": 2.4252561211585997,
"sampling/importance_sampling_ratio/mean": 0.983253824710846,
"sampling/importance_sampling_ratio/min": 0.17534216698259114,
"sampling/sampling_logp_difference/max": 0.9268244326114654,
"sampling/sampling_logp_difference/mean": 0.0035243292804807425,
"step": 17600,
"step_time": 4.112977161808521
}
],
"logging_steps": 10,
"max_steps": 100000,
"num_input_tokens_seen": 1706128701,
"num_train_epochs": 215,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}