[ { "loss": -0.5885732769966125, "grad_norm": 13.008904457092285, "learning_rate": 0.0, "num_tokens": 6268.0, "completions/mean_length": 100.625, "completions/min_length": 6.0, "completions/max_length": 292.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 100.625, "completions/min_terminated_length": 6.0, "completions/max_terminated_length": 292.0, "tools/call_frequency": 2.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.0024999999441206455, "rewards/reward_func/std": 0.007071067579090595, "reward": 0.0024999999441206455, "reward_std": 0.007071067579090595, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013445030897855759, "sampling/sampling_logp_difference/max": 0.35497260093688965, "sampling/importance_sampling_ratio/min": 0.7549628615379333, "sampling/importance_sampling_ratio/mean": 0.9896590113639832, "sampling/importance_sampling_ratio/max": 1.2683002948760986, "entropy": 0.524700028821826, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 37.835427328944206, "epoch": 2.604166666666667e-05, "step": 1 }, { "loss": -0.25129565596580505, "grad_norm": 8.018105506896973, "learning_rate": 1e-07, "num_tokens": 12735.0, "completions/mean_length": 123.375, "completions/min_length": 55.0, "completions/max_length": 263.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 123.375, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 263.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.0062500000931322575, "rewards/reward_func/std": 0.01767767034471035, "reward": 0.0062500000931322575, "reward_std": 0.0176776684820652, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013865306042134762, "sampling/sampling_logp_difference/max": 0.3017702102661133, "sampling/importance_sampling_ratio/min": 0.5517458319664001, "sampling/importance_sampling_ratio/mean": 0.8847103118896484, "sampling/importance_sampling_ratio/max": 1.180827260017395, "entropy": 0.4682434909045696, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 36.486059200018644, "epoch": 5.208333333333334e-05, "step": 2 }, { "loss": 0.0631505623459816, "grad_norm": 10.868307113647461, "learning_rate": 2e-07, "num_tokens": 19351.0, "completions/mean_length": 142.0, "completions/min_length": 50.0, "completions/max_length": 256.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 142.0, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 256.0, "tools/call_frequency": 3.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.004999999888241291, "rewards/reward_func/std": 0.009258201345801353, "reward": 0.004999999888241291, "reward_std": 0.009258200414478779, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012012362480163574, "sampling/sampling_logp_difference/max": 0.25799161195755005, "sampling/importance_sampling_ratio/min": 0.5464798212051392, "sampling/importance_sampling_ratio/mean": 0.9767583608627319, "sampling/importance_sampling_ratio/max": 1.5489927530288696, "entropy": 0.4367520771920681, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 36.46552266925573, "epoch": 7.8125e-05, "step": 3 }, { "loss": -0.3605692386627197, "grad_norm": 10.616016387939453, "learning_rate": 3e-07, "num_tokens": 25612.0, "completions/mean_length": 99.75, "completions/min_length": 5.0, "completions/max_length": 217.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 99.75, "completions/min_terminated_length": 5.0, "completions/max_terminated_length": 217.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.008750000037252903, "rewards/reward_func/std": 0.018077217042446136, "reward": 0.008750000037252903, "reward_std": 0.018077215179800987, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010256679728627205, "sampling/sampling_logp_difference/max": 0.232449471950531, "sampling/importance_sampling_ratio/min": 0.7233827710151672, "sampling/importance_sampling_ratio/mean": 1.0080759525299072, "sampling/importance_sampling_ratio/max": 1.7840412855148315, "entropy": 0.39893557876348495, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 36.25890198349953, "epoch": 0.00010416666666666667, "step": 4 }, { "loss": 0.0312654972076416, "grad_norm": 7.9504008293151855, "learning_rate": 4e-07, "num_tokens": 31985.0, "completions/mean_length": 113.25, "completions/min_length": 38.0, "completions/max_length": 224.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 113.25, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 224.0, "tools/call_frequency": 2.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.012500000186264515, "rewards/reward_func/std": 0.02314550243318081, "reward": 0.012500000186264515, "reward_std": 0.02314550243318081, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012847134843468666, "sampling/sampling_logp_difference/max": 0.4542774558067322, "sampling/importance_sampling_ratio/min": 0.7518625855445862, "sampling/importance_sampling_ratio/mean": 1.03047513961792, "sampling/importance_sampling_ratio/max": 1.4058701992034912, "entropy": 0.41092174872756004, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 36.09501961246133, "epoch": 0.00013020833333333333, "step": 5 }, { "loss": 0.08963602781295776, "grad_norm": 16.086267471313477, "learning_rate": 5e-07, "num_tokens": 38321.0, "completions/mean_length": 106.875, "completions/min_length": 30.0, "completions/max_length": 191.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 106.875, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 191.0, "tools/call_frequency": 1.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.008750000037252903, "rewards/reward_func/std": 0.018077217042446136, "reward": 0.008750000037252903, "reward_std": 0.018077215179800987, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.016527945175766945, "sampling/sampling_logp_difference/max": 0.5979750156402588, "sampling/importance_sampling_ratio/min": 0.6722250580787659, "sampling/importance_sampling_ratio/mean": 1.2993158102035522, "sampling/importance_sampling_ratio/max": 2.400960922241211, "entropy": 0.516218576580286, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 37.64127164706588, "epoch": 0.00015625, "step": 6 }, { "loss": -0.34489285945892334, "grad_norm": 13.213167190551758, "learning_rate": 6e-07, "num_tokens": 44748.0, "completions/mean_length": 122.375, "completions/min_length": 13.0, "completions/max_length": 256.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 122.375, "completions/min_terminated_length": 13.0, "completions/max_terminated_length": 256.0, "tools/call_frequency": 2.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.0062500000931322575, "rewards/reward_func/std": 0.01767767034471035, "reward": 0.0062500000931322575, "reward_std": 0.0176776684820652, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.014414949342608452, "sampling/sampling_logp_difference/max": 0.250272274017334, "sampling/importance_sampling_ratio/min": 0.3499795198440552, "sampling/importance_sampling_ratio/mean": 1.1435754299163818, "sampling/importance_sampling_ratio/max": 2.296891927719116, "entropy": 0.5273875612765551, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 36.501615941524506, "epoch": 0.00018229166666666667, "step": 7 }, { "loss": -0.8867464065551758, "grad_norm": 39.95463562011719, "learning_rate": 7e-07, "num_tokens": 50966.0, "completions/mean_length": 91.25, "completions/min_length": 6.0, "completions/max_length": 195.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 91.25, "completions/min_terminated_length": 6.0, "completions/max_terminated_length": 195.0, "tools/call_frequency": 2.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.004999999888241291, "rewards/reward_func/std": 0.009258201345801353, "reward": 0.004999999888241291, "reward_std": 0.009258200414478779, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.015028956346213818, "sampling/sampling_logp_difference/max": 0.4996461868286133, "sampling/importance_sampling_ratio/min": 0.6598324775695801, "sampling/importance_sampling_ratio/mean": 1.2359116077423096, "sampling/importance_sampling_ratio/max": 2.9642791748046875, "entropy": 0.4555971845984459, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 36.19891104847193, "epoch": 0.00020833333333333335, "step": 8 }, { "loss": 0.10192404687404633, "grad_norm": 4.609565734863281, "learning_rate": 8e-07, "num_tokens": 57249.0, "completions/mean_length": 102.25, "completions/min_length": 6.0, "completions/max_length": 279.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 102.25, "completions/min_terminated_length": 6.0, "completions/max_terminated_length": 279.0, "tools/call_frequency": 2.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.0024999999441206455, "rewards/reward_func/std": 0.007071067579090595, "reward": 0.0024999999441206455, "reward_std": 0.007071067579090595, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012550756335258484, "sampling/sampling_logp_difference/max": 0.38526344299316406, "sampling/importance_sampling_ratio/min": 0.6248411536216736, "sampling/importance_sampling_ratio/mean": 0.922042965888977, "sampling/importance_sampling_ratio/max": 1.2581053972244263, "entropy": 0.5312789976596832, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 36.4501080699265, "epoch": 0.000234375, "step": 9 }, { "loss": -0.434135377407074, "grad_norm": 8.397831916809082, "learning_rate": 9e-07, "num_tokens": 63863.0, "completions/mean_length": 141.625, "completions/min_length": 26.0, "completions/max_length": 320.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 141.625, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 320.0, "tools/call_frequency": 3.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.015000000596046448, "rewards/reward_func/std": 0.022677868604660034, "reward": 0.015000000596046448, "reward_std": 0.022677868604660034, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.014086291193962097, "sampling/sampling_logp_difference/max": 0.3863961696624756, "sampling/importance_sampling_ratio/min": 0.4828842878341675, "sampling/importance_sampling_ratio/mean": 1.0087132453918457, "sampling/importance_sampling_ratio/max": 1.504388451576233, "entropy": 0.6851713508367538, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 36.92686954140663, "epoch": 0.00026041666666666666, "step": 10 }, { "loss": -0.015748508274555206, "grad_norm": 6.6033124923706055, "learning_rate": 1e-06, "num_tokens": 70378.0, "completions/mean_length": 131.875, "completions/min_length": 36.0, "completions/max_length": 293.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 131.875, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 293.0, "tools/call_frequency": 3.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.008750000037252903, "rewards/reward_func/std": 0.018077217042446136, "reward": 0.008750000037252903, "reward_std": 0.018077215179800987, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013110029511153698, "sampling/sampling_logp_difference/max": 0.27173471450805664, "sampling/importance_sampling_ratio/min": 0.6055477261543274, "sampling/importance_sampling_ratio/mean": 1.0047043561935425, "sampling/importance_sampling_ratio/max": 1.881674885749817, "entropy": 0.5361065696924925, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 36.50432587787509, "epoch": 0.00028645833333333333, "step": 11 }, { "loss": -0.0023724809288978577, "grad_norm": 6.656985759735107, "learning_rate": 9.96551724137931e-07, "num_tokens": 76971.0, "completions/mean_length": 138.75, "completions/min_length": 39.0, "completions/max_length": 270.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 138.75, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 270.0, "tools/call_frequency": 3.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.016249999403953552, "rewards/reward_func/std": 0.01685018092393875, "reward": 0.016249999403953552, "reward_std": 0.01685018092393875, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011296343058347702, "sampling/sampling_logp_difference/max": 0.2637970447540283, "sampling/importance_sampling_ratio/min": 0.7121175527572632, "sampling/importance_sampling_ratio/mean": 0.8413591384887695, "sampling/importance_sampling_ratio/max": 1.2051576375961304, "entropy": 0.38445105217397213, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 28.530225463211536, "epoch": 0.0003125, "step": 12 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 9.93103448275862e-07, "num_tokens": 83927.0, "completions/mean_length": 185.75, "completions/min_length": 31.0, "completions/max_length": 335.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 185.75, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 335.0, "tools/call_frequency": 4.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.0, "rewards/reward_func/std": 0.0, "reward": 0.0, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.013238866813480854, "sampling/sampling_logp_difference/max": 0.4307551383972168, "sampling/importance_sampling_ratio/min": 0.47376495599746704, "sampling/importance_sampling_ratio/mean": 0.761107325553894, "sampling/importance_sampling_ratio/max": 1.2660465240478516, "entropy": 0.4054732918739319, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 21.391032822430134, "epoch": 0.0003385416666666667, "step": 13 }, { "loss": 0.02079951763153076, "grad_norm": 5.232540130615234, "learning_rate": 9.89655172413793e-07, "num_tokens": 90877.0, "completions/mean_length": 183.625, "completions/min_length": 37.0, "completions/max_length": 281.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 183.625, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 281.0, "tools/call_frequency": 5.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.011250000447034836, "rewards/reward_func/std": 0.018077217042446136, "reward": 0.011250000447034836, "reward_std": 0.018077215179800987, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01118296105414629, "sampling/sampling_logp_difference/max": 0.32562971115112305, "sampling/importance_sampling_ratio/min": 0.4047946035861969, "sampling/importance_sampling_ratio/mean": 0.8902381658554077, "sampling/importance_sampling_ratio/max": 1.861833095550537, "entropy": 0.364573635160923, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 20.64675822854042, "epoch": 0.00036458333333333335, "step": 14 }, { "loss": -0.17998479306697845, "grad_norm": 5.922213077545166, "learning_rate": 9.86206896551724e-07, "num_tokens": 97908.0, "completions/mean_length": 195.875, "completions/min_length": 23.0, "completions/max_length": 258.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 195.875, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 258.0, "tools/call_frequency": 5.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.013749999925494194, "rewards/reward_func/std": 0.01767767034471035, "reward": 0.013749999925494194, "reward_std": 0.0176776684820652, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008274673484265804, "sampling/sampling_logp_difference/max": 0.5427913665771484, "sampling/importance_sampling_ratio/min": 0.49513915181159973, "sampling/importance_sampling_ratio/mean": 0.9206554889678955, "sampling/importance_sampling_ratio/max": 1.5133479833602905, "entropy": 0.2687825821340084, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 21.60207199677825, "epoch": 0.000390625, "step": 15 }, { "loss": 0.03240010887384415, "grad_norm": 6.687302112579346, "learning_rate": 9.82758620689655e-07, "num_tokens": 104660.0, "completions/mean_length": 160.25, "completions/min_length": 64.0, "completions/max_length": 269.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 160.25, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 269.0, "tools/call_frequency": 4.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.008750000037252903, "rewards/reward_func/std": 0.018077217042446136, "reward": 0.008750000037252903, "reward_std": 0.018077215179800987, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011899923905730247, "sampling/sampling_logp_difference/max": 0.2562887668609619, "sampling/importance_sampling_ratio/min": 0.6062029004096985, "sampling/importance_sampling_ratio/mean": 1.1879191398620605, "sampling/importance_sampling_ratio/max": 2.131728172302246, "entropy": 0.3837167005985975, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 20.831536203622818, "epoch": 0.0004166666666666667, "step": 16 }, { "loss": -0.15749281644821167, "grad_norm": 6.5017170906066895, "learning_rate": 9.79310344827586e-07, "num_tokens": 111275.0, "completions/mean_length": 141.5, "completions/min_length": 35.0, "completions/max_length": 235.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 141.5, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 235.0, "tools/call_frequency": 3.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.019999999552965164, "rewards/reward_func/std": 0.020701967179775238, "reward": 0.019999999552965164, "reward_std": 0.020701967179775238, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009790186770260334, "sampling/sampling_logp_difference/max": 0.2380383014678955, "sampling/importance_sampling_ratio/min": 0.6131651997566223, "sampling/importance_sampling_ratio/mean": 1.048501968383789, "sampling/importance_sampling_ratio/max": 1.4037240743637085, "entropy": 0.37214965745806694, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 20.402552723884583, "epoch": 0.0004427083333333333, "step": 17 }, { "loss": -0.043051980435848236, "grad_norm": 5.14762020111084, "learning_rate": 9.75862068965517e-07, "num_tokens": 118213.0, "completions/mean_length": 181.875, "completions/min_length": 44.0, "completions/max_length": 233.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 181.875, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 233.0, "tools/call_frequency": 5.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.007499999832361937, "rewards/reward_func/std": 0.010350983589887619, "reward": 0.007499999832361937, "reward_std": 0.010350982658565044, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011298970319330692, "sampling/sampling_logp_difference/max": 0.25880563259124756, "sampling/importance_sampling_ratio/min": 0.4977272152900696, "sampling/importance_sampling_ratio/mean": 0.8073327541351318, "sampling/importance_sampling_ratio/max": 1.208906888961792, "entropy": 0.34852655604481697, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 20.707383673638105, "epoch": 0.00046875, "step": 18 }, { "loss": -0.14468500018119812, "grad_norm": 5.45598840713501, "learning_rate": 9.72413793103448e-07, "num_tokens": 124974.0, "completions/mean_length": 159.75, "completions/min_length": 98.0, "completions/max_length": 223.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 159.75, "completions/min_terminated_length": 98.0, "completions/max_terminated_length": 223.0, "tools/call_frequency": 4.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.032499998807907104, "rewards/reward_func/std": 0.019820624962449074, "reward": 0.032499998807907104, "reward_std": 0.019820624962449074, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.00898817740380764, "sampling/sampling_logp_difference/max": 0.3447690010070801, "sampling/importance_sampling_ratio/min": 0.5387510061264038, "sampling/importance_sampling_ratio/mean": 0.8799911737442017, "sampling/importance_sampling_ratio/max": 1.6199899911880493, "entropy": 0.34017826430499554, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 20.64898883551359, "epoch": 0.0004947916666666667, "step": 19 }, { "loss": -0.06275665760040283, "grad_norm": 8.189361572265625, "learning_rate": 9.689655172413793e-07, "num_tokens": 131762.0, "completions/mean_length": 163.375, "completions/min_length": 72.0, "completions/max_length": 278.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 163.375, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 278.0, "tools/call_frequency": 3.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.01875000074505806, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.01875000074505806, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012297180481255054, "sampling/sampling_logp_difference/max": 0.2399139404296875, "sampling/importance_sampling_ratio/min": 0.36634376645088196, "sampling/importance_sampling_ratio/mean": 1.0522818565368652, "sampling/importance_sampling_ratio/max": 1.9464819431304932, "entropy": 0.4162163510918617, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 20.708322688937187, "epoch": 0.0005208333333333333, "step": 20 }, { "loss": -0.04717805236577988, "grad_norm": 4.736361503601074, "learning_rate": 9.655172413793103e-07, "num_tokens": 138434.0, "completions/mean_length": 148.875, "completions/min_length": 39.0, "completions/max_length": 232.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 148.875, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 232.0, "tools/call_frequency": 4.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.02250000089406967, "rewards/reward_func/std": 0.019086269661784172, "reward": 0.02250000089406967, "reward_std": 0.019086269661784172, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009806210175156593, "sampling/sampling_logp_difference/max": 0.3546772003173828, "sampling/importance_sampling_ratio/min": 0.49156516790390015, "sampling/importance_sampling_ratio/mean": 0.854424238204956, "sampling/importance_sampling_ratio/max": 1.5377742052078247, "entropy": 0.3397639747709036, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 20.957030817866325, "epoch": 0.000546875, "step": 21 }, { "loss": 0.10890503972768784, "grad_norm": 8.61061954498291, "learning_rate": 9.620689655172413e-07, "num_tokens": 144977.0, "completions/mean_length": 132.75, "completions/min_length": 58.0, "completions/max_length": 219.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 132.75, "completions/min_terminated_length": 58.0, "completions/max_terminated_length": 219.0, "tools/call_frequency": 3.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.023749999701976776, "rewards/reward_func/std": 0.025599945336580276, "reward": 0.023749999701976776, "reward_std": 0.025599945336580276, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.006962330546230078, "sampling/sampling_logp_difference/max": 0.16659164428710938, "sampling/importance_sampling_ratio/min": 0.6960119009017944, "sampling/importance_sampling_ratio/mean": 1.0722699165344238, "sampling/importance_sampling_ratio/max": 1.4663054943084717, "entropy": 0.3046452794224024, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 20.846546791493893, "epoch": 0.0005729166666666667, "step": 22 }, { "loss": 0.05462484061717987, "grad_norm": 6.245155334472656, "learning_rate": 9.586206896551724e-07, "num_tokens": 151760.0, "completions/mean_length": 162.125, "completions/min_length": 91.0, "completions/max_length": 253.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 162.125, "completions/min_terminated_length": 91.0, "completions/max_terminated_length": 253.0, "tools/call_frequency": 4.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.028750000521540642, "rewards/reward_func/std": 0.018850920721888542, "reward": 0.028750000521540642, "reward_std": 0.018850918859243393, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010342186316847801, "sampling/sampling_logp_difference/max": 0.5263607501983643, "sampling/importance_sampling_ratio/min": 0.7085199952125549, "sampling/importance_sampling_ratio/mean": 0.9503569602966309, "sampling/importance_sampling_ratio/max": 1.2953131198883057, "entropy": 0.3539642468094826, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 21.316515784710646, "epoch": 0.0005989583333333333, "step": 23 }, { "loss": 0.10025905817747116, "grad_norm": 7.867324352264404, "learning_rate": 9.551724137931034e-07, "num_tokens": 158416.0, "completions/mean_length": 149.0, "completions/min_length": 30.0, "completions/max_length": 231.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 149.0, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 231.0, "tools/call_frequency": 4.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.021250000223517418, "rewards/reward_func/std": 0.02695896476507187, "reward": 0.021250000223517418, "reward_std": 0.02695896476507187, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.00749181117862463, "sampling/sampling_logp_difference/max": 0.22932815551757812, "sampling/importance_sampling_ratio/min": 0.44922351837158203, "sampling/importance_sampling_ratio/mean": 1.052233338356018, "sampling/importance_sampling_ratio/max": 1.6336404085159302, "entropy": 0.28345833718776703, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 20.681581370532513, "epoch": 0.000625, "step": 24 }, { "loss": -0.08836822211742401, "grad_norm": 5.426852226257324, "learning_rate": 9.517241379310345e-07, "num_tokens": 165000.0, "completions/mean_length": 139.875, "completions/min_length": 47.0, "completions/max_length": 230.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 139.875, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 230.0, "tools/call_frequency": 4.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.028750000521540642, "rewards/reward_func/std": 0.018850920721888542, "reward": 0.028750000521540642, "reward_std": 0.018850918859243393, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009383185766637325, "sampling/sampling_logp_difference/max": 0.33803892135620117, "sampling/importance_sampling_ratio/min": 0.5007726550102234, "sampling/importance_sampling_ratio/mean": 0.8847082257270813, "sampling/importance_sampling_ratio/max": 1.2992891073226929, "entropy": 0.30262799747288227, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 20.605320628732443, "epoch": 0.0006510416666666666, "step": 25 }, { "loss": -0.0026366226375102997, "grad_norm": 4.845335960388184, "learning_rate": 9.482758620689655e-07, "num_tokens": 171435.0, "completions/mean_length": 121.25, "completions/min_length": 45.0, "completions/max_length": 219.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 121.25, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 219.0, "tools/call_frequency": 3.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.01875000074505806, "rewards/reward_func/std": 0.015526474453508854, "reward": 0.01875000074505806, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008715836331248283, "sampling/sampling_logp_difference/max": 0.22706031799316406, "sampling/importance_sampling_ratio/min": 0.4022264778614044, "sampling/importance_sampling_ratio/mean": 0.8477516770362854, "sampling/importance_sampling_ratio/max": 1.6113998889923096, "entropy": 0.32572532072663307, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 20.443785045295954, "epoch": 0.0006770833333333334, "step": 26 }, { "loss": 0.03460419178009033, "grad_norm": 5.734435558319092, "learning_rate": 9.448275862068965e-07, "num_tokens": 178352.0, "completions/mean_length": 178.625, "completions/min_length": 55.0, "completions/max_length": 237.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 178.625, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 237.0, "tools/call_frequency": 5.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.023749999701976776, "rewards/reward_func/std": 0.025599945336580276, "reward": 0.023749999701976776, "reward_std": 0.025599945336580276, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009394889697432518, "sampling/sampling_logp_difference/max": 0.2116551399230957, "sampling/importance_sampling_ratio/min": 0.6561595797538757, "sampling/importance_sampling_ratio/mean": 1.0656712055206299, "sampling/importance_sampling_ratio/max": 1.9904744625091553, "entropy": 0.3666235599666834, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 21.021979205310345, "epoch": 0.000703125, "step": 27 }, { "loss": -0.22922024130821228, "grad_norm": 8.727387428283691, "learning_rate": 9.413793103448276e-07, "num_tokens": 184907.0, "completions/mean_length": 133.875, "completions/min_length": 57.0, "completions/max_length": 211.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 133.875, "completions/min_terminated_length": 57.0, "completions/max_terminated_length": 211.0, "tools/call_frequency": 3.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.02250000089406967, "rewards/reward_func/std": 0.019086269661784172, "reward": 0.02250000089406967, "reward_std": 0.019086269661784172, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.00895582977682352, "sampling/sampling_logp_difference/max": 0.24191522598266602, "sampling/importance_sampling_ratio/min": 0.5283964276313782, "sampling/importance_sampling_ratio/mean": 0.9204263687133789, "sampling/importance_sampling_ratio/max": 1.3373774290084839, "entropy": 0.36481352895498276, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 20.425370667129755, "epoch": 0.0007291666666666667, "step": 28 }, { "loss": -0.01819920912384987, "grad_norm": 5.154520511627197, "learning_rate": 9.379310344827586e-07, "num_tokens": 191496.0, "completions/mean_length": 139.75, "completions/min_length": 46.0, "completions/max_length": 198.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 139.75, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 198.0, "tools/call_frequency": 3.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.01875000074505806, "rewards/reward_func/std": 0.015526474453508854, "reward": 0.01875000074505806, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008894074708223343, "sampling/sampling_logp_difference/max": 0.22660303115844727, "sampling/importance_sampling_ratio/min": 0.41451773047447205, "sampling/importance_sampling_ratio/mean": 0.8284684419631958, "sampling/importance_sampling_ratio/max": 1.5668686628341675, "entropy": 0.3417188785970211, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 20.44797110557556, "epoch": 0.0007552083333333333, "step": 29 }, { "loss": -0.20519858598709106, "grad_norm": 5.991239070892334, "learning_rate": 9.344827586206896e-07, "num_tokens": 198263.0, "completions/mean_length": 160.25, "completions/min_length": 41.0, "completions/max_length": 253.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 160.25, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 253.0, "tools/call_frequency": 4.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.032499998807907104, "rewards/reward_func/std": 0.019820624962449074, "reward": 0.032499998807907104, "reward_std": 0.019820624962449074, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009669131599366665, "sampling/sampling_logp_difference/max": 0.23380827903747559, "sampling/importance_sampling_ratio/min": 0.6005908846855164, "sampling/importance_sampling_ratio/mean": 0.9316152930259705, "sampling/importance_sampling_ratio/max": 1.503471851348877, "entropy": 0.3355466667562723, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 21.340124938637018, "epoch": 0.00078125, "step": 30 }, { "loss": -0.01702813431620598, "grad_norm": 7.362905502319336, "learning_rate": 9.310344827586206e-07, "num_tokens": 204824.0, "completions/mean_length": 134.75, "completions/min_length": 92.0, "completions/max_length": 228.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 134.75, "completions/min_terminated_length": 92.0, "completions/max_terminated_length": 228.0, "tools/call_frequency": 3.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.036250002682209015, "rewards/reward_func/std": 0.019955307245254517, "reward": 0.036250002682209015, "reward_std": 0.019955307245254517, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009860306978225708, "sampling/sampling_logp_difference/max": 0.3035142421722412, "sampling/importance_sampling_ratio/min": 0.5170778036117554, "sampling/importance_sampling_ratio/mean": 0.9038935899734497, "sampling/importance_sampling_ratio/max": 1.1554527282714844, "entropy": 0.3615808691829443, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 20.256591100245714, "epoch": 0.0008072916666666667, "step": 31 }, { "loss": -0.032833755016326904, "grad_norm": 4.283570766448975, "learning_rate": 9.275862068965516e-07, "num_tokens": 211429.0, "completions/mean_length": 142.125, "completions/min_length": 44.0, "completions/max_length": 220.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 142.125, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 220.0, "tools/call_frequency": 3.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.032499998807907104, "rewards/reward_func/std": 0.019820624962449074, "reward": 0.032499998807907104, "reward_std": 0.019820624962449074, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009062220342457294, "sampling/sampling_logp_difference/max": 0.22057127952575684, "sampling/importance_sampling_ratio/min": 0.6157566905021667, "sampling/importance_sampling_ratio/mean": 0.8454524278640747, "sampling/importance_sampling_ratio/max": 1.1623364686965942, "entropy": 0.3047413844615221, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 20.30556419491768, "epoch": 0.0008333333333333334, "step": 32 }, { "loss": -0.1124148815870285, "grad_norm": 5.204093933105469, "learning_rate": 9.241379310344826e-07, "num_tokens": 218476.0, "completions/mean_length": 194.125, "completions/min_length": 35.0, "completions/max_length": 258.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 194.125, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 258.0, "tools/call_frequency": 5.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.021250000223517418, "rewards/reward_func/std": 0.013562027364969254, "reward": 0.021250000223517418, "reward_std": 0.013562026433646679, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011322963051497936, "sampling/sampling_logp_difference/max": 0.33586275577545166, "sampling/importance_sampling_ratio/min": 0.4237613081932068, "sampling/importance_sampling_ratio/mean": 1.0884665250778198, "sampling/importance_sampling_ratio/max": 1.9433987140655518, "entropy": 0.3970138616859913, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 20.684372786432505, "epoch": 0.000859375, "step": 33 }, { "loss": 0.3120284378528595, "grad_norm": 5.788089275360107, "learning_rate": 9.206896551724138e-07, "num_tokens": 225237.0, "completions/mean_length": 158.875, "completions/min_length": 89.0, "completions/max_length": 238.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 158.875, "completions/min_terminated_length": 89.0, "completions/max_terminated_length": 238.0, "tools/call_frequency": 4.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.027499999850988388, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.027499999850988388, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008865631185472012, "sampling/sampling_logp_difference/max": 0.2181529998779297, "sampling/importance_sampling_ratio/min": 0.6731056571006775, "sampling/importance_sampling_ratio/mean": 1.1323657035827637, "sampling/importance_sampling_ratio/max": 1.9685696363449097, "entropy": 0.31718801334500313, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 12.480241607874632, "epoch": 0.0008854166666666666, "step": 34 }, { "loss": -0.01565421000123024, "grad_norm": 4.152030944824219, "learning_rate": 9.172413793103448e-07, "num_tokens": 232228.0, "completions/mean_length": 188.375, "completions/min_length": 110.0, "completions/max_length": 234.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 188.375, "completions/min_terminated_length": 110.0, "completions/max_terminated_length": 234.0, "tools/call_frequency": 5.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.007795717567205429, "sampling/sampling_logp_difference/max": 0.25260043144226074, "sampling/importance_sampling_ratio/min": 0.5036969184875488, "sampling/importance_sampling_ratio/mean": 0.7785353660583496, "sampling/importance_sampling_ratio/max": 1.1340864896774292, "entropy": 0.28588490188121796, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.830931171774864, "epoch": 0.0009114583333333333, "step": 35 }, { "loss": -0.03426661342382431, "grad_norm": 6.349575042724609, "learning_rate": 9.137931034482759e-07, "num_tokens": 239060.0, "completions/mean_length": 168.375, "completions/min_length": 92.0, "completions/max_length": 244.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 168.375, "completions/min_terminated_length": 92.0, "completions/max_terminated_length": 244.0, "tools/call_frequency": 4.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.026250001043081284, "rewards/reward_func/std": 0.02386719174683094, "reward": 0.026250001043081284, "reward_std": 0.02386719174683094, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.007818865589797497, "sampling/sampling_logp_difference/max": 0.2404015064239502, "sampling/importance_sampling_ratio/min": 0.7001102566719055, "sampling/importance_sampling_ratio/mean": 1.0841290950775146, "sampling/importance_sampling_ratio/max": 1.383851408958435, "entropy": 0.2678183987736702, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.062030844390392, "epoch": 0.0009375, "step": 36 }, { "loss": 0.35137784481048584, "grad_norm": 7.164522647857666, "learning_rate": 9.103448275862069e-07, "num_tokens": 245858.0, "completions/mean_length": 162.875, "completions/min_length": 67.0, "completions/max_length": 258.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 162.875, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 258.0, "tools/call_frequency": 4.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03125, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.03125, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011881194077432156, "sampling/sampling_logp_difference/max": 0.3850877285003662, "sampling/importance_sampling_ratio/min": 0.5915504693984985, "sampling/importance_sampling_ratio/mean": 0.9095719456672668, "sampling/importance_sampling_ratio/max": 2.0288326740264893, "entropy": 0.36159021966159344, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.889691513031721, "epoch": 0.0009635416666666667, "step": 37 }, { "loss": -0.10781438648700714, "grad_norm": 7.6127543449401855, "learning_rate": 9.068965517241379e-07, "num_tokens": 252586.0, "completions/mean_length": 154.875, "completions/min_length": 79.0, "completions/max_length": 248.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 154.875, "completions/min_terminated_length": 79.0, "completions/max_terminated_length": 248.0, "tools/call_frequency": 3.625, "tools/failure_frequency": 0.03448275849223137, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010863994248211384, "sampling/sampling_logp_difference/max": 0.5725090503692627, "sampling/importance_sampling_ratio/min": 0.524786651134491, "sampling/importance_sampling_ratio/mean": 0.905246376991272, "sampling/importance_sampling_ratio/max": 1.6983059644699097, "entropy": 0.3136354796588421, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 6.001252330839634, "epoch": 0.0009895833333333334, "step": 38 }, { "loss": -0.09975679963827133, "grad_norm": 6.176290035247803, "learning_rate": 9.034482758620689e-07, "num_tokens": 259001.0, "completions/mean_length": 115.625, "completions/min_length": 45.0, "completions/max_length": 228.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 115.625, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 228.0, "tools/call_frequency": 2.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.030000001192092896, "rewards/reward_func/std": 0.022677868604660034, "reward": 0.030000001192092896, "reward_std": 0.022677868604660034, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.00891152024269104, "sampling/sampling_logp_difference/max": 0.3750847578048706, "sampling/importance_sampling_ratio/min": 0.639533281326294, "sampling/importance_sampling_ratio/mean": 0.8951395750045776, "sampling/importance_sampling_ratio/max": 1.2477972507476807, "entropy": 0.24010402336716652, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.6655657440423965, "epoch": 0.001015625, "step": 39 }, { "loss": 0.13084544241428375, "grad_norm": 6.87970495223999, "learning_rate": 9e-07, "num_tokens": 265401.0, "completions/mean_length": 114.375, "completions/min_length": 76.0, "completions/max_length": 193.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 114.375, "completions/min_terminated_length": 76.0, "completions/max_terminated_length": 193.0, "tools/call_frequency": 2.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.00781896524131298, "sampling/sampling_logp_difference/max": 0.19175148010253906, "sampling/importance_sampling_ratio/min": 0.7254706025123596, "sampling/importance_sampling_ratio/mean": 0.963738203048706, "sampling/importance_sampling_ratio/max": 1.148192048072815, "entropy": 0.26008577831089497, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.308024551719427, "epoch": 0.0010416666666666667, "step": 40 }, { "loss": -0.054356008768081665, "grad_norm": 5.049872875213623, "learning_rate": 8.96551724137931e-07, "num_tokens": 272181.0, "completions/mean_length": 161.75, "completions/min_length": 67.0, "completions/max_length": 246.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 161.75, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 246.0, "tools/call_frequency": 4.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03125, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.03125, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01043853908777237, "sampling/sampling_logp_difference/max": 0.4462606906890869, "sampling/importance_sampling_ratio/min": 0.38138890266418457, "sampling/importance_sampling_ratio/mean": 0.7119714617729187, "sampling/importance_sampling_ratio/max": 1.171438455581665, "entropy": 0.3081154990941286, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.617127258330584, "epoch": 0.0010677083333333333, "step": 41 }, { "loss": 0.10210782289505005, "grad_norm": 6.514715194702148, "learning_rate": 8.93103448275862e-07, "num_tokens": 278770.0, "completions/mean_length": 137.5, "completions/min_length": 69.0, "completions/max_length": 243.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 137.5, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 243.0, "tools/call_frequency": 3.625, "tools/failure_frequency": 0.03448275849223137, "rewards/reward_func/mean": 0.03125, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.03125, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010128241032361984, "sampling/sampling_logp_difference/max": 0.24643254280090332, "sampling/importance_sampling_ratio/min": 0.5159069299697876, "sampling/importance_sampling_ratio/mean": 0.8559343814849854, "sampling/importance_sampling_ratio/max": 1.3772742748260498, "entropy": 0.2935776449739933, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.669547338038683, "epoch": 0.00109375, "step": 42 }, { "loss": 0.3554345965385437, "grad_norm": 8.031490325927734, "learning_rate": 8.896551724137931e-07, "num_tokens": 285494.0, "completions/mean_length": 154.875, "completions/min_length": 92.0, "completions/max_length": 218.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 154.875, "completions/min_terminated_length": 92.0, "completions/max_terminated_length": 218.0, "tools/call_frequency": 4.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008680367842316628, "sampling/sampling_logp_difference/max": 0.3858180046081543, "sampling/importance_sampling_ratio/min": 0.5469220876693726, "sampling/importance_sampling_ratio/mean": 1.0541657209396362, "sampling/importance_sampling_ratio/max": 1.5864670276641846, "entropy": 0.27114896662533283, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.974387422204018, "epoch": 0.0011197916666666667, "step": 43 }, { "loss": 0.10589627176523209, "grad_norm": 5.162812232971191, "learning_rate": 8.862068965517241e-07, "num_tokens": 292356.0, "completions/mean_length": 172.125, "completions/min_length": 115.0, "completions/max_length": 248.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 172.125, "completions/min_terminated_length": 115.0, "completions/max_terminated_length": 248.0, "tools/call_frequency": 5.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.026250001043081284, "rewards/reward_func/std": 0.02386719174683094, "reward": 0.026250001043081284, "reward_std": 0.02386719174683094, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.007868079468607903, "sampling/sampling_logp_difference/max": 0.24561452865600586, "sampling/importance_sampling_ratio/min": 0.6875799298286438, "sampling/importance_sampling_ratio/mean": 1.0054194927215576, "sampling/importance_sampling_ratio/max": 1.3888652324676514, "entropy": 0.2661617901176214, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.709124103188515, "epoch": 0.0011458333333333333, "step": 44 }, { "loss": -0.0591389499604702, "grad_norm": 7.834764003753662, "learning_rate": 8.827586206896551e-07, "num_tokens": 299027.0, "completions/mean_length": 147.75, "completions/min_length": 67.0, "completions/max_length": 226.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 147.75, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 226.0, "tools/call_frequency": 3.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009236816316843033, "sampling/sampling_logp_difference/max": 0.5252978801727295, "sampling/importance_sampling_ratio/min": 0.35149699449539185, "sampling/importance_sampling_ratio/mean": 1.1181907653808594, "sampling/importance_sampling_ratio/max": 1.6860265731811523, "entropy": 0.278241541236639, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.473275948315859, "epoch": 0.001171875, "step": 45 }, { "loss": -0.27108079195022583, "grad_norm": 2.7441484928131104, "learning_rate": 8.793103448275862e-07, "num_tokens": 305938.0, "completions/mean_length": 178.25, "completions/min_length": 43.0, "completions/max_length": 234.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 178.25, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 234.0, "tools/call_frequency": 5.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.017500000074505806, "rewards/reward_func/std": 0.007071067579090595, "reward": 0.017500000074505806, "reward_std": 0.007071067579090595, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008638064377009869, "sampling/sampling_logp_difference/max": 0.31515026092529297, "sampling/importance_sampling_ratio/min": 0.5775101184844971, "sampling/importance_sampling_ratio/mean": 0.8990919589996338, "sampling/importance_sampling_ratio/max": 2.1571614742279053, "entropy": 0.2913599815219641, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.4653757363557816, "epoch": 0.0011979166666666666, "step": 46 }, { "loss": 0.4079431891441345, "grad_norm": 8.527111053466797, "learning_rate": 8.758620689655172e-07, "num_tokens": 312575.0, "completions/mean_length": 144.0, "completions/min_length": 78.0, "completions/max_length": 223.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 144.0, "completions/min_terminated_length": 78.0, "completions/max_terminated_length": 223.0, "tools/call_frequency": 3.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009136517532169819, "sampling/sampling_logp_difference/max": 0.22486400604248047, "sampling/importance_sampling_ratio/min": 0.5707057118415833, "sampling/importance_sampling_ratio/mean": 1.077945351600647, "sampling/importance_sampling_ratio/max": 1.7271728515625, "entropy": 0.2839373517781496, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.54995883256197, "epoch": 0.0012239583333333334, "step": 47 }, { "loss": 0.4644259214401245, "grad_norm": 8.421874046325684, "learning_rate": 8.724137931034482e-07, "num_tokens": 319242.0, "completions/mean_length": 146.75, "completions/min_length": 73.0, "completions/max_length": 215.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 146.75, "completions/min_terminated_length": 73.0, "completions/max_terminated_length": 215.0, "tools/call_frequency": 3.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03125, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.03125, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011644345708191395, "sampling/sampling_logp_difference/max": 0.30409717559814453, "sampling/importance_sampling_ratio/min": 0.32547813653945923, "sampling/importance_sampling_ratio/mean": 1.2393231391906738, "sampling/importance_sampling_ratio/max": 2.443915367126465, "entropy": 0.3517550267279148, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.6201141737401485, "epoch": 0.00125, "step": 48 }, { "loss": 0.49574077129364014, "grad_norm": 18.6467342376709, "learning_rate": 8.689655172413792e-07, "num_tokens": 325552.0, "completions/mean_length": 102.375, "completions/min_length": 66.0, "completions/max_length": 214.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 102.375, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 214.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010042176581919193, "sampling/sampling_logp_difference/max": 0.3463928699493408, "sampling/importance_sampling_ratio/min": 0.6331563591957092, "sampling/importance_sampling_ratio/mean": 1.3004318475723267, "sampling/importance_sampling_ratio/max": 2.691237688064575, "entropy": 0.2693322170525789, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.315858248621225, "epoch": 0.0012760416666666666, "step": 49 }, { "loss": -0.03001394122838974, "grad_norm": 8.571084022521973, "learning_rate": 8.655172413793102e-07, "num_tokens": 332066.0, "completions/mean_length": 129.0, "completions/min_length": 68.0, "completions/max_length": 201.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 129.0, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 201.0, "tools/call_frequency": 3.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03125, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.03125, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008165487088263035, "sampling/sampling_logp_difference/max": 0.1741194725036621, "sampling/importance_sampling_ratio/min": 0.3725735545158386, "sampling/importance_sampling_ratio/mean": 0.9180060029029846, "sampling/importance_sampling_ratio/max": 1.2996761798858643, "entropy": 0.2941217888146639, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.545101586729288, "epoch": 0.0013020833333333333, "step": 50 }, { "loss": 0.16267147660255432, "grad_norm": 6.111854553222656, "learning_rate": 8.620689655172412e-07, "num_tokens": 338709.0, "completions/mean_length": 145.0, "completions/min_length": 68.0, "completions/max_length": 213.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 145.0, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 213.0, "tools/call_frequency": 3.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008833810687065125, "sampling/sampling_logp_difference/max": 0.16674041748046875, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.8426108360290527, "sampling/importance_sampling_ratio/max": 1.2174991369247437, "entropy": 0.3227213490754366, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.482032455503941, "epoch": 0.001328125, "step": 51 }, { "loss": 0.3188627064228058, "grad_norm": 7.887113571166992, "learning_rate": 8.586206896551725e-07, "num_tokens": 345148.0, "completions/mean_length": 118.5, "completions/min_length": 67.0, "completions/max_length": 245.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 118.5, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 245.0, "tools/call_frequency": 2.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.00836735125631094, "sampling/sampling_logp_difference/max": 0.5611782073974609, "sampling/importance_sampling_ratio/min": 0.5012302994728088, "sampling/importance_sampling_ratio/mean": 0.9718648195266724, "sampling/importance_sampling_ratio/max": 1.4218385219573975, "entropy": 0.2617574315518141, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.429679621011019, "epoch": 0.0013541666666666667, "step": 52 }, { "loss": 0.01578430086374283, "grad_norm": 5.9074907302856445, "learning_rate": 8.551724137931035e-07, "num_tokens": 351570.0, "completions/mean_length": 116.375, "completions/min_length": 66.0, "completions/max_length": 204.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 116.375, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 204.0, "tools/call_frequency": 2.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009270556271076202, "sampling/sampling_logp_difference/max": 0.22868609428405762, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.7753545045852661, "sampling/importance_sampling_ratio/max": 1.0618292093276978, "entropy": 0.2742783650755882, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.451155975461006, "epoch": 0.0013802083333333333, "step": 53 }, { "loss": 0.2927618622779846, "grad_norm": 5.427998065948486, "learning_rate": 8.517241379310345e-07, "num_tokens": 358062.0, "completions/mean_length": 124.875, "completions/min_length": 66.0, "completions/max_length": 194.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 124.875, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 194.0, "tools/call_frequency": 3.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03125, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.03125, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0062236059457063675, "sampling/sampling_logp_difference/max": 0.194604754447937, "sampling/importance_sampling_ratio/min": 0.6389504075050354, "sampling/importance_sampling_ratio/mean": 1.0062472820281982, "sampling/importance_sampling_ratio/max": 1.3035187721252441, "entropy": 0.24960640631616116, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.2454654313623905, "epoch": 0.00140625, "step": 54 }, { "loss": 0.2581663131713867, "grad_norm": 5.975019454956055, "learning_rate": 8.482758620689655e-07, "num_tokens": 364799.0, "completions/mean_length": 156.0, "completions/min_length": 95.0, "completions/max_length": 198.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 156.0, "completions/min_terminated_length": 95.0, "completions/max_terminated_length": 198.0, "tools/call_frequency": 4.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008163003250956535, "sampling/sampling_logp_difference/max": 0.6210435628890991, "sampling/importance_sampling_ratio/min": 0.6495955586433411, "sampling/importance_sampling_ratio/mean": 0.953213095664978, "sampling/importance_sampling_ratio/max": 1.4132004976272583, "entropy": 0.2986908555030823, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.385646548122168, "epoch": 0.0014322916666666666, "step": 55 }, { "loss": 0.2269374132156372, "grad_norm": 8.06528091430664, "learning_rate": 8.448275862068965e-07, "num_tokens": 371400.0, "completions/mean_length": 139.5, "completions/min_length": 69.0, "completions/max_length": 207.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 139.5, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 207.0, "tools/call_frequency": 3.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009682541713118553, "sampling/sampling_logp_difference/max": 0.24823331832885742, "sampling/importance_sampling_ratio/min": 0.5804888010025024, "sampling/importance_sampling_ratio/mean": 0.9588527679443359, "sampling/importance_sampling_ratio/max": 1.7588474750518799, "entropy": 0.33883928693830967, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.46031716093421, "epoch": 0.0014583333333333334, "step": 56 }, { "loss": 0.4875653386116028, "grad_norm": 8.86308765411377, "learning_rate": 8.413793103448276e-07, "num_tokens": 378029.0, "completions/mean_length": 142.25, "completions/min_length": 61.0, "completions/max_length": 211.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 142.25, "completions/min_terminated_length": 61.0, "completions/max_terminated_length": 211.0, "tools/call_frequency": 3.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.00951333250850439, "sampling/sampling_logp_difference/max": 0.2538604736328125, "sampling/importance_sampling_ratio/min": 0.7266653180122375, "sampling/importance_sampling_ratio/mean": 1.09211266040802, "sampling/importance_sampling_ratio/max": 2.018314838409424, "entropy": 0.29050587117671967, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.540868993848562, "epoch": 0.001484375, "step": 57 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 8.379310344827586e-07, "num_tokens": 384926.0, "completions/mean_length": 176.375, "completions/min_length": 69.0, "completions/max_length": 203.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 176.375, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 203.0, "tools/call_frequency": 4.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.019999999552965164, "rewards/reward_func/std": 0.0, "reward": 0.019999999552965164, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.008876016363501549, "sampling/sampling_logp_difference/max": 0.2492060661315918, "sampling/importance_sampling_ratio/min": 0.34912109375, "sampling/importance_sampling_ratio/mean": 1.1389708518981934, "sampling/importance_sampling_ratio/max": 1.7648930549621582, "entropy": 0.3012118451297283, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.786813877522945, "epoch": 0.0015104166666666666, "step": 58 }, { "loss": 0.43448126316070557, "grad_norm": 7.258548736572266, "learning_rate": 8.344827586206896e-07, "num_tokens": 391685.0, "completions/mean_length": 159.25, "completions/min_length": 65.0, "completions/max_length": 268.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 159.25, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 268.0, "tools/call_frequency": 4.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008550588972866535, "sampling/sampling_logp_difference/max": 0.30316686630249023, "sampling/importance_sampling_ratio/min": 0.6319384574890137, "sampling/importance_sampling_ratio/mean": 1.0341280698776245, "sampling/importance_sampling_ratio/max": 1.453060269355774, "entropy": 0.2590454611927271, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.722654994577169, "epoch": 0.0015364583333333333, "step": 59 }, { "loss": 0.4190652072429657, "grad_norm": 5.93164587020874, "learning_rate": 8.310344827586206e-07, "num_tokens": 398536.0, "completions/mean_length": 171.0, "completions/min_length": 94.0, "completions/max_length": 220.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 171.0, "completions/min_terminated_length": 94.0, "completions/max_terminated_length": 220.0, "tools/call_frequency": 4.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03125, "rewards/reward_func/std": 0.015526474453508854, "reward": 0.03125, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008862054906785488, "sampling/sampling_logp_difference/max": 0.3719472885131836, "sampling/importance_sampling_ratio/min": 0.5541459321975708, "sampling/importance_sampling_ratio/mean": 1.0519256591796875, "sampling/importance_sampling_ratio/max": 2.1038596630096436, "entropy": 0.2931892015039921, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.494029957801104, "epoch": 0.0015625, "step": 60 }, { "loss": 0.15857936441898346, "grad_norm": 8.685916900634766, "learning_rate": 8.275862068965517e-07, "num_tokens": 405044.0, "completions/mean_length": 127.375, "completions/min_length": 70.0, "completions/max_length": 197.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 127.375, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 197.0, "tools/call_frequency": 3.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.007522088009864092, "sampling/sampling_logp_difference/max": 0.3648815155029297, "sampling/importance_sampling_ratio/min": 0.6608204245567322, "sampling/importance_sampling_ratio/mean": 1.0251034498214722, "sampling/importance_sampling_ratio/max": 1.4037553071975708, "entropy": 0.27771896682679653, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.440516646951437, "epoch": 0.0015885416666666667, "step": 61 }, { "loss": 0.32254666090011597, "grad_norm": 5.963048458099365, "learning_rate": 8.241379310344827e-07, "num_tokens": 411641.0, "completions/mean_length": 138.375, "completions/min_length": 66.0, "completions/max_length": 210.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 138.375, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 210.0, "tools/call_frequency": 3.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.007839164696633816, "sampling/sampling_logp_difference/max": 0.23007869720458984, "sampling/importance_sampling_ratio/min": 0.6602538824081421, "sampling/importance_sampling_ratio/mean": 0.9414231777191162, "sampling/importance_sampling_ratio/max": 1.372970700263977, "entropy": 0.2681508809328079, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.223766557872295, "epoch": 0.0016145833333333333, "step": 62 }, { "loss": -0.11863896250724792, "grad_norm": 6.0240607261657715, "learning_rate": 8.206896551724138e-07, "num_tokens": 418248.0, "completions/mean_length": 138.75, "completions/min_length": 63.0, "completions/max_length": 241.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 138.75, "completions/min_terminated_length": 63.0, "completions/max_terminated_length": 241.0, "tools/call_frequency": 3.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01045276876538992, "sampling/sampling_logp_difference/max": 0.5996453762054443, "sampling/importance_sampling_ratio/min": 0.5518931150436401, "sampling/importance_sampling_ratio/mean": 0.9240298271179199, "sampling/importance_sampling_ratio/max": 1.277245283126831, "entropy": 0.27107655815780163, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.433187335729599, "epoch": 0.001640625, "step": 63 }, { "loss": 0.13411760330200195, "grad_norm": 5.554072856903076, "learning_rate": 8.172413793103448e-07, "num_tokens": 424651.0, "completions/mean_length": 114.375, "completions/min_length": 66.0, "completions/max_length": 222.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 114.375, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 222.0, "tools/call_frequency": 2.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.007139751687645912, "sampling/sampling_logp_difference/max": 0.3027305006980896, "sampling/importance_sampling_ratio/min": 0.6346269845962524, "sampling/importance_sampling_ratio/mean": 0.91048663854599, "sampling/importance_sampling_ratio/max": 1.3474019765853882, "entropy": 0.2682610508054495, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.310452304780483, "epoch": 0.0016666666666666668, "step": 64 }, { "loss": 0.05218823254108429, "grad_norm": 6.961463928222656, "learning_rate": 8.137931034482758e-07, "num_tokens": 431413.0, "completions/mean_length": 159.5, "completions/min_length": 75.0, "completions/max_length": 218.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 159.5, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 218.0, "tools/call_frequency": 4.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03125, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.03125, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009722557850182056, "sampling/sampling_logp_difference/max": 0.4775857925415039, "sampling/importance_sampling_ratio/min": 0.489254891872406, "sampling/importance_sampling_ratio/mean": 0.990435004234314, "sampling/importance_sampling_ratio/max": 1.5411198139190674, "entropy": 0.31989192217588425, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.8169816471636295, "epoch": 0.0016927083333333334, "step": 65 }, { "loss": 0.1483156681060791, "grad_norm": 5.2921600341796875, "learning_rate": 8.103448275862068e-07, "num_tokens": 438101.0, "completions/mean_length": 149.875, "completions/min_length": 100.0, "completions/max_length": 197.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 149.875, "completions/min_terminated_length": 100.0, "completions/max_terminated_length": 197.0, "tools/call_frequency": 3.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008863834664225578, "sampling/sampling_logp_difference/max": 0.23262500762939453, "sampling/importance_sampling_ratio/min": 0.7470085024833679, "sampling/importance_sampling_ratio/mean": 1.033771276473999, "sampling/importance_sampling_ratio/max": 1.3561131954193115, "entropy": 0.3145777303725481, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.523774567991495, "epoch": 0.00171875, "step": 66 }, { "loss": 0.49514874815940857, "grad_norm": 9.326838493347168, "learning_rate": 8.068965517241378e-07, "num_tokens": 444648.0, "completions/mean_length": 133.5, "completions/min_length": 65.0, "completions/max_length": 207.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 133.5, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 207.0, "tools/call_frequency": 3.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008789469487965107, "sampling/sampling_logp_difference/max": 0.30263692140579224, "sampling/importance_sampling_ratio/min": 0.6185657978057861, "sampling/importance_sampling_ratio/mean": 0.9254890084266663, "sampling/importance_sampling_ratio/max": 1.8509927988052368, "entropy": 0.249217065051198, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.356932740658522, "epoch": 0.0017447916666666666, "step": 67 }, { "loss": 0.0597718209028244, "grad_norm": 5.220883846282959, "learning_rate": 8.03448275862069e-07, "num_tokens": 451296.0, "completions/mean_length": 145.375, "completions/min_length": 60.0, "completions/max_length": 206.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 145.375, "completions/min_terminated_length": 60.0, "completions/max_terminated_length": 206.0, "tools/call_frequency": 3.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.00736664142459631, "sampling/sampling_logp_difference/max": 0.2861800193786621, "sampling/importance_sampling_ratio/min": 0.5959981083869934, "sampling/importance_sampling_ratio/mean": 0.8661595582962036, "sampling/importance_sampling_ratio/max": 1.1282408237457275, "entropy": 0.2769886516034603, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.352283425629139, "epoch": 0.0017708333333333332, "step": 68 }, { "loss": 0.06623853743076324, "grad_norm": 5.788069248199463, "learning_rate": 8e-07, "num_tokens": 458096.0, "completions/mean_length": 164.0, "completions/min_length": 106.0, "completions/max_length": 208.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 164.0, "completions/min_terminated_length": 106.0, "completions/max_terminated_length": 208.0, "tools/call_frequency": 4.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009317398071289062, "sampling/sampling_logp_difference/max": 0.21917223930358887, "sampling/importance_sampling_ratio/min": 0.611605167388916, "sampling/importance_sampling_ratio/mean": 0.9942731857299805, "sampling/importance_sampling_ratio/max": 1.3109467029571533, "entropy": 0.311614690348506, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.737263236194849, "epoch": 0.001796875, "step": 69 }, { "loss": 0.36793047189712524, "grad_norm": 5.774531841278076, "learning_rate": 7.965517241379311e-07, "num_tokens": 464754.0, "completions/mean_length": 146.5, "completions/min_length": 65.0, "completions/max_length": 190.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 146.5, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 190.0, "tools/call_frequency": 4.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.007341146469116211, "sampling/sampling_logp_difference/max": 0.24997520446777344, "sampling/importance_sampling_ratio/min": 0.6762236952781677, "sampling/importance_sampling_ratio/mean": 0.9699811339378357, "sampling/importance_sampling_ratio/max": 1.3894898891448975, "entropy": 0.2440620381385088, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.231471247971058, "epoch": 0.0018229166666666667, "step": 70 }, { "loss": 0.1511472910642624, "grad_norm": 8.596271514892578, "learning_rate": 7.931034482758621e-07, "num_tokens": 471250.0, "completions/mean_length": 126.0, "completions/min_length": 69.0, "completions/max_length": 210.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 126.0, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 210.0, "tools/call_frequency": 3.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008768534287810326, "sampling/sampling_logp_difference/max": 0.29262351989746094, "sampling/importance_sampling_ratio/min": 0.4767390787601471, "sampling/importance_sampling_ratio/mean": 1.0032906532287598, "sampling/importance_sampling_ratio/max": 1.9425359964370728, "entropy": 0.2569956723600626, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.341728907078505, "epoch": 0.0018489583333333333, "step": 71 }, { "loss": 0.38776475191116333, "grad_norm": 8.212038040161133, "learning_rate": 7.896551724137931e-07, "num_tokens": 477871.0, "completions/mean_length": 142.125, "completions/min_length": 79.0, "completions/max_length": 207.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 142.125, "completions/min_terminated_length": 79.0, "completions/max_terminated_length": 207.0, "tools/call_frequency": 3.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.007148672826588154, "sampling/sampling_logp_difference/max": 0.3373904228210449, "sampling/importance_sampling_ratio/min": 0.40989330410957336, "sampling/importance_sampling_ratio/mean": 0.9974186420440674, "sampling/importance_sampling_ratio/max": 1.454021692276001, "entropy": 0.2415281105786562, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.433367874473333, "epoch": 0.001875, "step": 72 }, { "loss": 0.06242813169956207, "grad_norm": 5.431676387786865, "learning_rate": 7.862068965517241e-07, "num_tokens": 484612.0, "completions/mean_length": 156.875, "completions/min_length": 68.0, "completions/max_length": 204.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 156.875, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 204.0, "tools/call_frequency": 4.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008229869417846203, "sampling/sampling_logp_difference/max": 0.2365880012512207, "sampling/importance_sampling_ratio/min": 0.5166167616844177, "sampling/importance_sampling_ratio/mean": 0.9250579476356506, "sampling/importance_sampling_ratio/max": 1.69414484500885, "entropy": 0.25781176798045635, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.521351788192987, "epoch": 0.0019010416666666668, "step": 73 }, { "loss": 0.5322186946868896, "grad_norm": 10.943680763244629, "learning_rate": 7.827586206896552e-07, "num_tokens": 491122.0, "completions/mean_length": 128.0, "completions/min_length": 71.0, "completions/max_length": 212.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 128.0, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 212.0, "tools/call_frequency": 3.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.007571771740913391, "sampling/sampling_logp_difference/max": 0.2457261085510254, "sampling/importance_sampling_ratio/min": 0.9035890102386475, "sampling/importance_sampling_ratio/mean": 1.2514183521270752, "sampling/importance_sampling_ratio/max": 1.9857929944992065, "entropy": 0.23851043544709682, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.459375135600567, "epoch": 0.0019270833333333334, "step": 74 }, { "loss": 0.46099984645843506, "grad_norm": 8.244654655456543, "learning_rate": 7.793103448275862e-07, "num_tokens": 497745.0, "completions/mean_length": 141.625, "completions/min_length": 68.0, "completions/max_length": 220.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 141.625, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 220.0, "tools/call_frequency": 3.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008362981490790844, "sampling/sampling_logp_difference/max": 0.2385869026184082, "sampling/importance_sampling_ratio/min": 0.6858067512512207, "sampling/importance_sampling_ratio/mean": 0.920607328414917, "sampling/importance_sampling_ratio/max": 1.2481027841567993, "entropy": 0.27047605998814106, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.52291614562273, "epoch": 0.001953125, "step": 75 }, { "loss": 0.09317575395107269, "grad_norm": 8.134749412536621, "learning_rate": 7.758620689655172e-07, "num_tokens": 504029.0, "completions/mean_length": 99.125, "completions/min_length": 65.0, "completions/max_length": 189.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 99.125, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 189.0, "tools/call_frequency": 2.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008144235238432884, "sampling/sampling_logp_difference/max": 0.24631929397583008, "sampling/importance_sampling_ratio/min": 0.5056509971618652, "sampling/importance_sampling_ratio/mean": 0.8456082344055176, "sampling/importance_sampling_ratio/max": 1.098840594291687, "entropy": 0.218337994068861, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.183943759649992, "epoch": 0.001979166666666667, "step": 76 }, { "loss": 0.570663332939148, "grad_norm": 8.915884971618652, "learning_rate": 7.724137931034482e-07, "num_tokens": 510678.0, "completions/mean_length": 145.125, "completions/min_length": 69.0, "completions/max_length": 232.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 145.125, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 232.0, "tools/call_frequency": 3.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010542435571551323, "sampling/sampling_logp_difference/max": 0.22301673889160156, "sampling/importance_sampling_ratio/min": 0.392640084028244, "sampling/importance_sampling_ratio/mean": 1.2197747230529785, "sampling/importance_sampling_ratio/max": 2.2301859855651855, "entropy": 0.32936161383986473, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.636154614388943, "epoch": 0.0020052083333333332, "step": 77 }, { "loss": 0.13454610109329224, "grad_norm": 6.01003360748291, "learning_rate": 7.689655172413792e-07, "num_tokens": 517154.0, "completions/mean_length": 123.375, "completions/min_length": 66.0, "completions/max_length": 199.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 123.375, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 199.0, "tools/call_frequency": 3.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010016914457082748, "sampling/sampling_logp_difference/max": 0.4396820068359375, "sampling/importance_sampling_ratio/min": 0.47836941480636597, "sampling/importance_sampling_ratio/mean": 1.0448076725006104, "sampling/importance_sampling_ratio/max": 1.7316462993621826, "entropy": 0.2553398059681058, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.166990853846073, "epoch": 0.00203125, "step": 78 }, { "loss": 0.2500889301300049, "grad_norm": 5.0226216316223145, "learning_rate": 7.655172413793102e-07, "num_tokens": 524019.0, "completions/mean_length": 172.875, "completions/min_length": 118.0, "completions/max_length": 216.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 172.875, "completions/min_terminated_length": 118.0, "completions/max_terminated_length": 216.0, "tools/call_frequency": 4.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008261576294898987, "sampling/sampling_logp_difference/max": 0.3001713752746582, "sampling/importance_sampling_ratio/min": 0.5074343681335449, "sampling/importance_sampling_ratio/mean": 0.876280665397644, "sampling/importance_sampling_ratio/max": 1.602623462677002, "entropy": 0.29555561020970345, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.524432118982077, "epoch": 0.0020572916666666665, "step": 79 }, { "loss": 0.6009180545806885, "grad_norm": 8.971160888671875, "learning_rate": 7.620689655172414e-07, "num_tokens": 530438.0, "completions/mean_length": 116.5, "completions/min_length": 63.0, "completions/max_length": 204.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 116.5, "completions/min_terminated_length": 63.0, "completions/max_terminated_length": 204.0, "tools/call_frequency": 2.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008285257034003735, "sampling/sampling_logp_difference/max": 0.2853531837463379, "sampling/importance_sampling_ratio/min": 0.7052885890007019, "sampling/importance_sampling_ratio/mean": 1.0779139995574951, "sampling/importance_sampling_ratio/max": 1.542609453201294, "entropy": 0.25474693067371845, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.504926174879074, "epoch": 0.0020833333333333333, "step": 80 }, { "loss": 0.2352580726146698, "grad_norm": 6.356550216674805, "learning_rate": 7.586206896551724e-07, "num_tokens": 537036.0, "completions/mean_length": 138.0, "completions/min_length": 66.0, "completions/max_length": 212.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 138.0, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 212.0, "tools/call_frequency": 3.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526474453508854, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.007834731601178646, "sampling/sampling_logp_difference/max": 0.2130584716796875, "sampling/importance_sampling_ratio/min": 0.8550736308097839, "sampling/importance_sampling_ratio/mean": 1.0940049886703491, "sampling/importance_sampling_ratio/max": 1.4123036861419678, "entropy": 0.29896221682429314, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.5186101868748665, "epoch": 0.002109375, "step": 81 }, { "loss": 0.2918560206890106, "grad_norm": 5.458775520324707, "learning_rate": 7.551724137931034e-07, "num_tokens": 543973.0, "completions/mean_length": 181.25, "completions/min_length": 83.0, "completions/max_length": 258.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 181.25, "completions/min_terminated_length": 83.0, "completions/max_terminated_length": 258.0, "tools/call_frequency": 4.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03125, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.03125, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0094722555950284, "sampling/sampling_logp_difference/max": 0.30549657344818115, "sampling/importance_sampling_ratio/min": 0.4431401789188385, "sampling/importance_sampling_ratio/mean": 1.0626211166381836, "sampling/importance_sampling_ratio/max": 1.974442958831787, "entropy": 0.3471503220498562, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.858669966459274, "epoch": 0.0021354166666666665, "step": 82 }, { "loss": -0.05157988891005516, "grad_norm": 6.189342021942139, "learning_rate": 7.517241379310344e-07, "num_tokens": 550616.0, "completions/mean_length": 145.0, "completions/min_length": 63.0, "completions/max_length": 220.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 145.0, "completions/min_terminated_length": 63.0, "completions/max_terminated_length": 220.0, "tools/call_frequency": 3.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009663700126111507, "sampling/sampling_logp_difference/max": 0.3085569143295288, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.9613282084465027, "sampling/importance_sampling_ratio/max": 1.4465934038162231, "entropy": 0.284167492762208, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.456232123076916, "epoch": 0.0021614583333333334, "step": 83 }, { "loss": 0.21563875675201416, "grad_norm": 6.461734771728516, "learning_rate": 7.482758620689655e-07, "num_tokens": 557107.0, "completions/mean_length": 126.375, "completions/min_length": 66.0, "completions/max_length": 238.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 126.375, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 238.0, "tools/call_frequency": 3.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008060681633651257, "sampling/sampling_logp_difference/max": 0.25173044204711914, "sampling/importance_sampling_ratio/min": 0.47610586881637573, "sampling/importance_sampling_ratio/mean": 0.8433263897895813, "sampling/importance_sampling_ratio/max": 1.2606743574142456, "entropy": 0.24939616210758686, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.385654982179403, "epoch": 0.0021875, "step": 84 }, { "loss": 0.6945865154266357, "grad_norm": 8.50930404663086, "learning_rate": 7.448275862068965e-07, "num_tokens": 563826.0, "completions/mean_length": 154.0, "completions/min_length": 65.0, "completions/max_length": 220.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 154.0, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 220.0, "tools/call_frequency": 4.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03125, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.03125, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009406828321516514, "sampling/sampling_logp_difference/max": 0.21660232543945312, "sampling/importance_sampling_ratio/min": 0.5684511661529541, "sampling/importance_sampling_ratio/mean": 1.337892770767212, "sampling/importance_sampling_ratio/max": 2.909498929977417, "entropy": 0.3046402707695961, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.353375978767872, "epoch": 0.0022135416666666666, "step": 85 }, { "loss": -0.06191016733646393, "grad_norm": 5.368035316467285, "learning_rate": 7.413793103448276e-07, "num_tokens": 570733.0, "completions/mean_length": 177.25, "completions/min_length": 115.0, "completions/max_length": 215.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 177.25, "completions/min_terminated_length": 115.0, "completions/max_terminated_length": 215.0, "tools/call_frequency": 5.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.027499999850988388, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.027499999850988388, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.007655786350369453, "sampling/sampling_logp_difference/max": 0.2167069911956787, "sampling/importance_sampling_ratio/min": 0.7241263389587402, "sampling/importance_sampling_ratio/mean": 0.9419474601745605, "sampling/importance_sampling_ratio/max": 1.1550995111465454, "entropy": 0.2920949477702379, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.499181512743235, "epoch": 0.0022395833333333334, "step": 86 }, { "loss": 0.8515288829803467, "grad_norm": 17.70108413696289, "learning_rate": 7.379310344827586e-07, "num_tokens": 577255.0, "completions/mean_length": 129.125, "completions/min_length": 71.0, "completions/max_length": 224.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 129.125, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 224.0, "tools/call_frequency": 3.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.007969329133629799, "sampling/sampling_logp_difference/max": 0.24946022033691406, "sampling/importance_sampling_ratio/min": 0.7997300028800964, "sampling/importance_sampling_ratio/mean": 1.3395278453826904, "sampling/importance_sampling_ratio/max": 2.239732503890991, "entropy": 0.2848993130028248, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.399962909519672, "epoch": 0.002265625, "step": 87 }, { "loss": 0.25452882051467896, "grad_norm": 6.64228630065918, "learning_rate": 7.344827586206897e-07, "num_tokens": 584148.0, "completions/mean_length": 175.5, "completions/min_length": 71.0, "completions/max_length": 263.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 175.5, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 263.0, "tools/call_frequency": 4.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03125, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.03125, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009299642406404018, "sampling/sampling_logp_difference/max": 0.38968801498413086, "sampling/importance_sampling_ratio/min": 0.6392223834991455, "sampling/importance_sampling_ratio/mean": 1.0492146015167236, "sampling/importance_sampling_ratio/max": 1.52628755569458, "entropy": 0.3547398392111063, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.728387854993343, "epoch": 0.0022916666666666667, "step": 88 }, { "loss": 0.1478448212146759, "grad_norm": 6.071128845214844, "learning_rate": 7.310344827586207e-07, "num_tokens": 590640.0, "completions/mean_length": 126.0, "completions/min_length": 66.0, "completions/max_length": 208.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 126.0, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 208.0, "tools/call_frequency": 3.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008932434022426605, "sampling/sampling_logp_difference/max": 0.2498931884765625, "sampling/importance_sampling_ratio/min": 0.5249428153038025, "sampling/importance_sampling_ratio/mean": 0.9446492195129395, "sampling/importance_sampling_ratio/max": 1.2786856889724731, "entropy": 0.253721933811903, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.359964806586504, "epoch": 0.0023177083333333335, "step": 89 }, { "loss": 0.3898836076259613, "grad_norm": 3.808424234390259, "learning_rate": 7.275862068965517e-07, "num_tokens": 597435.0, "completions/mean_length": 164.125, "completions/min_length": 69.0, "completions/max_length": 227.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 164.125, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 227.0, "tools/call_frequency": 4.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03125, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.03125, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.007341077085584402, "sampling/sampling_logp_difference/max": 0.24884438514709473, "sampling/importance_sampling_ratio/min": 0.5126860737800598, "sampling/importance_sampling_ratio/mean": 0.8337280750274658, "sampling/importance_sampling_ratio/max": 1.5602962970733643, "entropy": 0.2886700499802828, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.560893692076206, "epoch": 0.00234375, "step": 90 }, { "loss": 0.08567449450492859, "grad_norm": 7.263461589813232, "learning_rate": 7.241379310344827e-07, "num_tokens": 604204.0, "completions/mean_length": 160.25, "completions/min_length": 68.0, "completions/max_length": 220.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 160.25, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 220.0, "tools/call_frequency": 4.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010189800523221493, "sampling/sampling_logp_difference/max": 0.2825280427932739, "sampling/importance_sampling_ratio/min": 0.6635783314704895, "sampling/importance_sampling_ratio/mean": 1.100722312927246, "sampling/importance_sampling_ratio/max": 1.9450410604476929, "entropy": 0.3187738787382841, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.511255070567131, "epoch": 0.0023697916666666667, "step": 91 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 7.206896551724138e-07, "num_tokens": 611405.0, "completions/mean_length": 214.375, "completions/min_length": 195.0, "completions/max_length": 240.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 214.375, "completions/min_terminated_length": 195.0, "completions/max_terminated_length": 240.0, "tools/call_frequency": 6.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.019999999552965164, "rewards/reward_func/std": 0.0, "reward": 0.019999999552965164, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.010789207182824612, "sampling/sampling_logp_difference/max": 0.4990198612213135, "sampling/importance_sampling_ratio/min": 0.5940403342247009, "sampling/importance_sampling_ratio/mean": 0.9162781834602356, "sampling/importance_sampling_ratio/max": 1.4239654541015625, "entropy": 0.4032662734389305, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.9268285520374775, "epoch": 0.002395833333333333, "step": 92 }, { "loss": 0.13994011282920837, "grad_norm": 6.414453029632568, "learning_rate": 7.172413793103448e-07, "num_tokens": 617916.0, "completions/mean_length": 127.75, "completions/min_length": 62.0, "completions/max_length": 234.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 127.75, "completions/min_terminated_length": 62.0, "completions/max_terminated_length": 234.0, "tools/call_frequency": 2.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010887646116316319, "sampling/sampling_logp_difference/max": 0.23942828178405762, "sampling/importance_sampling_ratio/min": 0.6223735213279724, "sampling/importance_sampling_ratio/mean": 0.9778643846511841, "sampling/importance_sampling_ratio/max": 1.4726736545562744, "entropy": 0.36310600489377975, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.33135436847806, "epoch": 0.002421875, "step": 93 }, { "loss": 0.1991899162530899, "grad_norm": 8.0427885055542, "learning_rate": 7.137931034482758e-07, "num_tokens": 624325.0, "completions/mean_length": 115.25, "completions/min_length": 66.0, "completions/max_length": 228.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 115.25, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 228.0, "tools/call_frequency": 2.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010500107891857624, "sampling/sampling_logp_difference/max": 0.24846124649047852, "sampling/importance_sampling_ratio/min": 0.597498893737793, "sampling/importance_sampling_ratio/mean": 0.9912357330322266, "sampling/importance_sampling_ratio/max": 1.8281104564666748, "entropy": 0.2825307007879019, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.036309238523245, "epoch": 0.002447916666666667, "step": 94 }, { "loss": 0.5406280755996704, "grad_norm": 7.821378231048584, "learning_rate": 7.103448275862068e-07, "num_tokens": 631078.0, "completions/mean_length": 158.75, "completions/min_length": 71.0, "completions/max_length": 231.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 158.75, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 231.0, "tools/call_frequency": 3.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009617233648896217, "sampling/sampling_logp_difference/max": 0.21808719635009766, "sampling/importance_sampling_ratio/min": 0.8593995571136475, "sampling/importance_sampling_ratio/mean": 1.1358684301376343, "sampling/importance_sampling_ratio/max": 1.709311604499817, "entropy": 0.3756424766033888, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.825226806104183, "epoch": 0.0024739583333333332, "step": 95 }, { "loss": 0.53407883644104, "grad_norm": 7.026584625244141, "learning_rate": 7.068965517241378e-07, "num_tokens": 637694.0, "completions/mean_length": 140.75, "completions/min_length": 70.0, "completions/max_length": 263.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 140.75, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 263.0, "tools/call_frequency": 3.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008432169444859028, "sampling/sampling_logp_difference/max": 0.22923564910888672, "sampling/importance_sampling_ratio/min": 0.5495845675468445, "sampling/importance_sampling_ratio/mean": 1.0923351049423218, "sampling/importance_sampling_ratio/max": 1.7565199136734009, "entropy": 0.2904543075710535, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.567758847028017, "epoch": 0.0025, "step": 96 }, { "loss": -0.000713050365447998, "grad_norm": 6.309239387512207, "learning_rate": 7.034482758620688e-07, "num_tokens": 644119.0, "completions/mean_length": 117.0, "completions/min_length": 68.0, "completions/max_length": 227.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 117.0, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 227.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008647211827337742, "sampling/sampling_logp_difference/max": 0.4868502616882324, "sampling/importance_sampling_ratio/min": 0.5282098054885864, "sampling/importance_sampling_ratio/mean": 0.893794596195221, "sampling/importance_sampling_ratio/max": 1.185192346572876, "entropy": 0.28001012466847897, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.321182422339916, "epoch": 0.0025260416666666665, "step": 97 }, { "loss": 0.23587137460708618, "grad_norm": 6.945014953613281, "learning_rate": 7e-07, "num_tokens": 650813.0, "completions/mean_length": 150.625, "completions/min_length": 96.0, "completions/max_length": 247.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 150.625, "completions/min_terminated_length": 96.0, "completions/max_terminated_length": 247.0, "tools/call_frequency": 3.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008644724264740944, "sampling/sampling_logp_difference/max": 0.2679615020751953, "sampling/importance_sampling_ratio/min": 0.22528891265392303, "sampling/importance_sampling_ratio/mean": 0.8298790454864502, "sampling/importance_sampling_ratio/max": 1.3694086074829102, "entropy": 0.28797223791480064, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.442151132971048, "epoch": 0.0025520833333333333, "step": 98 }, { "loss": 0.2695174813270569, "grad_norm": 8.812966346740723, "learning_rate": 6.96551724137931e-07, "num_tokens": 657238.0, "completions/mean_length": 116.375, "completions/min_length": 67.0, "completions/max_length": 210.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 116.375, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 210.0, "tools/call_frequency": 2.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008048093877732754, "sampling/sampling_logp_difference/max": 0.20413684844970703, "sampling/importance_sampling_ratio/min": 0.4447140097618103, "sampling/importance_sampling_ratio/mean": 0.8850213289260864, "sampling/importance_sampling_ratio/max": 1.1496365070343018, "entropy": 0.25912114046514034, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.412706505507231, "epoch": 0.002578125, "step": 99 }, { "loss": 0.29190051555633545, "grad_norm": 11.16254711151123, "learning_rate": 6.931034482758621e-07, "num_tokens": 663548.0, "completions/mean_length": 103.125, "completions/min_length": 34.0, "completions/max_length": 270.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 103.125, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 270.0, "tools/call_frequency": 1.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03999999910593033, "rewards/reward_func/std": 0.01927248388528824, "reward": 0.03999999910593033, "reward_std": 0.01927248202264309, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.00992105808109045, "sampling/sampling_logp_difference/max": 0.24373388290405273, "sampling/importance_sampling_ratio/min": 0.7359528541564941, "sampling/importance_sampling_ratio/mean": 1.0251843929290771, "sampling/importance_sampling_ratio/max": 1.4961566925048828, "entropy": 0.28604586608707905, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.247550934553146, "epoch": 0.0026041666666666665, "step": 100 }, { "loss": 0.24865862727165222, "grad_norm": 5.261774063110352, "learning_rate": 6.896551724137931e-07, "num_tokens": 670343.0, "completions/mean_length": 163.375, "completions/min_length": 94.0, "completions/max_length": 240.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 163.375, "completions/min_terminated_length": 94.0, "completions/max_terminated_length": 240.0, "tools/call_frequency": 4.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009819349274039268, "sampling/sampling_logp_difference/max": 0.36313843727111816, "sampling/importance_sampling_ratio/min": 0.41267672181129456, "sampling/importance_sampling_ratio/mean": 0.9107467532157898, "sampling/importance_sampling_ratio/max": 1.6202714443206787, "entropy": 0.335450554266572, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.4468593411147594, "epoch": 0.0026302083333333334, "step": 101 }, { "loss": -0.0854048877954483, "grad_norm": 3.224552631378174, "learning_rate": 6.862068965517241e-07, "num_tokens": 676892.0, "completions/mean_length": 133.5, "completions/min_length": 67.0, "completions/max_length": 249.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 133.5, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 249.0, "tools/call_frequency": 3.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0092065604403615, "sampling/sampling_logp_difference/max": 0.3598816394805908, "sampling/importance_sampling_ratio/min": 0.28250178694725037, "sampling/importance_sampling_ratio/mean": 0.8323373198509216, "sampling/importance_sampling_ratio/max": 1.2101935148239136, "entropy": 0.31629459373652935, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.2624360509216785, "epoch": 0.00265625, "step": 102 }, { "loss": 0.18058490753173828, "grad_norm": 6.811054229736328, "learning_rate": 6.827586206896552e-07, "num_tokens": 683130.0, "completions/mean_length": 93.875, "completions/min_length": 66.0, "completions/max_length": 201.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 93.875, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 201.0, "tools/call_frequency": 1.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.007291003596037626, "sampling/sampling_logp_difference/max": 0.22459936141967773, "sampling/importance_sampling_ratio/min": 0.5617707967758179, "sampling/importance_sampling_ratio/mean": 0.9265198707580566, "sampling/importance_sampling_ratio/max": 1.5528124570846558, "entropy": 0.25530113093554974, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.358579859137535, "epoch": 0.0026822916666666666, "step": 103 }, { "loss": 0.6638057231903076, "grad_norm": 11.878508567810059, "learning_rate": 6.793103448275862e-07, "num_tokens": 689624.0, "completions/mean_length": 126.0, "completions/min_length": 63.0, "completions/max_length": 239.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 126.0, "completions/min_terminated_length": 63.0, "completions/max_terminated_length": 239.0, "tools/call_frequency": 3.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008976939134299755, "sampling/sampling_logp_difference/max": 0.20221185684204102, "sampling/importance_sampling_ratio/min": 0.6644434928894043, "sampling/importance_sampling_ratio/mean": 1.0369466543197632, "sampling/importance_sampling_ratio/max": 1.4996607303619385, "entropy": 0.2792720487341285, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.436473652720451, "epoch": 0.0027083333333333334, "step": 104 }, { "loss": 0.38534292578697205, "grad_norm": 7.971909999847412, "learning_rate": 6.758620689655172e-07, "num_tokens": 696204.0, "completions/mean_length": 136.125, "completions/min_length": 67.0, "completions/max_length": 236.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 136.125, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 236.0, "tools/call_frequency": 3.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008056542836129665, "sampling/sampling_logp_difference/max": 0.22664499282836914, "sampling/importance_sampling_ratio/min": 0.4758111834526062, "sampling/importance_sampling_ratio/mean": 0.9010859727859497, "sampling/importance_sampling_ratio/max": 1.4847228527069092, "entropy": 0.29511207714676857, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.513696450740099, "epoch": 0.002734375, "step": 105 }, { "loss": 0.457573264837265, "grad_norm": 12.70578670501709, "learning_rate": 6.724137931034482e-07, "num_tokens": 702845.0, "completions/mean_length": 144.375, "completions/min_length": 65.0, "completions/max_length": 242.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 144.375, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 242.0, "tools/call_frequency": 3.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009682387113571167, "sampling/sampling_logp_difference/max": 0.29464268684387207, "sampling/importance_sampling_ratio/min": 0.40440255403518677, "sampling/importance_sampling_ratio/mean": 0.9459686279296875, "sampling/importance_sampling_ratio/max": 1.7747485637664795, "entropy": 0.33646082133054733, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.841759774833918, "epoch": 0.0027604166666666667, "step": 106 }, { "loss": 0.04955286160111427, "grad_norm": 4.8294219970703125, "learning_rate": 6.689655172413793e-07, "num_tokens": 709580.0, "completions/mean_length": 156.5, "completions/min_length": 65.0, "completions/max_length": 240.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 156.5, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 240.0, "tools/call_frequency": 3.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01016034372150898, "sampling/sampling_logp_difference/max": 0.28028392791748047, "sampling/importance_sampling_ratio/min": 0.42742687463760376, "sampling/importance_sampling_ratio/mean": 0.8592504262924194, "sampling/importance_sampling_ratio/max": 1.526597499847412, "entropy": 0.3489740416407585, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.500570334494114, "epoch": 0.0027864583333333335, "step": 107 }, { "loss": -0.029814463108778, "grad_norm": 5.221089839935303, "learning_rate": 6.655172413793103e-07, "num_tokens": 715992.0, "completions/mean_length": 116.375, "completions/min_length": 28.0, "completions/max_length": 222.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 116.375, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 222.0, "tools/call_frequency": 2.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.036250002682209015, "rewards/reward_func/std": 0.019955307245254517, "reward": 0.036250002682209015, "reward_std": 0.019955307245254517, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010254090651869774, "sampling/sampling_logp_difference/max": 0.47780680656433105, "sampling/importance_sampling_ratio/min": 0.4960949420928955, "sampling/importance_sampling_ratio/mean": 0.821640133857727, "sampling/importance_sampling_ratio/max": 1.0076278448104858, "entropy": 0.3187275193631649, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.351175215095282, "epoch": 0.0028125, "step": 108 }, { "loss": 0.14341574907302856, "grad_norm": 8.162286758422852, "learning_rate": 6.620689655172414e-07, "num_tokens": 722540.0, "completions/mean_length": 133.125, "completions/min_length": 68.0, "completions/max_length": 258.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 133.125, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 258.0, "tools/call_frequency": 3.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008738499134778976, "sampling/sampling_logp_difference/max": 0.20012903213500977, "sampling/importance_sampling_ratio/min": 0.46840620040893555, "sampling/importance_sampling_ratio/mean": 0.8534986972808838, "sampling/importance_sampling_ratio/max": 1.053305983543396, "entropy": 0.28179205395281315, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.393744621425867, "epoch": 0.0028385416666666667, "step": 109 }, { "loss": 0.10319685935974121, "grad_norm": 8.913573265075684, "learning_rate": 6.586206896551724e-07, "num_tokens": 729130.0, "completions/mean_length": 137.875, "completions/min_length": 67.0, "completions/max_length": 243.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 137.875, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 243.0, "tools/call_frequency": 3.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010171914473176003, "sampling/sampling_logp_difference/max": 0.2502436637878418, "sampling/importance_sampling_ratio/min": 0.6672365665435791, "sampling/importance_sampling_ratio/mean": 1.1061110496520996, "sampling/importance_sampling_ratio/max": 1.88072669506073, "entropy": 0.32766908034682274, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.572240140289068, "epoch": 0.002864583333333333, "step": 110 }, { "loss": 0.1610165536403656, "grad_norm": 5.715359687805176, "learning_rate": 6.551724137931034e-07, "num_tokens": 735703.0, "completions/mean_length": 134.875, "completions/min_length": 71.0, "completions/max_length": 221.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 134.875, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 221.0, "tools/call_frequency": 3.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010177217423915863, "sampling/sampling_logp_difference/max": 0.29056406021118164, "sampling/importance_sampling_ratio/min": 0.6527516841888428, "sampling/importance_sampling_ratio/mean": 0.9015135169029236, "sampling/importance_sampling_ratio/max": 1.4877452850341797, "entropy": 0.36283982545137405, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.478623580187559, "epoch": 0.002890625, "step": 111 }, { "loss": 0.4657711386680603, "grad_norm": 6.806517601013184, "learning_rate": 6.517241379310344e-07, "num_tokens": 742608.0, "completions/mean_length": 178.0, "completions/min_length": 82.0, "completions/max_length": 236.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 178.0, "completions/min_terminated_length": 82.0, "completions/max_terminated_length": 236.0, "tools/call_frequency": 4.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03125, "rewards/reward_func/std": 0.015526474453508854, "reward": 0.03125, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010571856983006, "sampling/sampling_logp_difference/max": 0.2958518862724304, "sampling/importance_sampling_ratio/min": 0.7404189705848694, "sampling/importance_sampling_ratio/mean": 1.228243112564087, "sampling/importance_sampling_ratio/max": 2.1055681705474854, "entropy": 0.39382102340459824, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.539896458387375, "epoch": 0.002916666666666667, "step": 112 }, { "loss": -0.002735935151576996, "grad_norm": 6.4718427658081055, "learning_rate": 6.482758620689654e-07, "num_tokens": 749343.0, "completions/mean_length": 155.5, "completions/min_length": 72.0, "completions/max_length": 213.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 155.5, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 213.0, "tools/call_frequency": 4.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008946622721850872, "sampling/sampling_logp_difference/max": 0.25611066818237305, "sampling/importance_sampling_ratio/min": 0.6189490556716919, "sampling/importance_sampling_ratio/mean": 1.1781431436538696, "sampling/importance_sampling_ratio/max": 1.9483999013900757, "entropy": 0.31166014447808266, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.413219831883907, "epoch": 0.002942708333333333, "step": 113 }, { "loss": 0.09774579107761383, "grad_norm": 6.762694835662842, "learning_rate": 6.448275862068964e-07, "num_tokens": 756072.0, "completions/mean_length": 155.75, "completions/min_length": 69.0, "completions/max_length": 261.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 155.75, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 261.0, "tools/call_frequency": 3.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010585418902337551, "sampling/sampling_logp_difference/max": 0.3630194664001465, "sampling/importance_sampling_ratio/min": 0.610520601272583, "sampling/importance_sampling_ratio/mean": 0.9006423950195312, "sampling/importance_sampling_ratio/max": 1.4365479946136475, "entropy": 0.35176357068121433, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.380906347185373, "epoch": 0.00296875, "step": 114 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 6.413793103448275e-07, "num_tokens": 762515.0, "completions/mean_length": 119.0, "completions/min_length": 73.0, "completions/max_length": 209.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 119.0, "completions/min_terminated_length": 73.0, "completions/max_terminated_length": 209.0, "tools/call_frequency": 2.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.007782564964145422, "sampling/sampling_logp_difference/max": 0.19623231887817383, "sampling/importance_sampling_ratio/min": 0.7612641453742981, "sampling/importance_sampling_ratio/mean": 1.01596200466156, "sampling/importance_sampling_ratio/max": 1.5096235275268555, "entropy": 0.2919827215373516, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.673809587955475, "epoch": 0.002994791666666667, "step": 115 }, { "loss": 0.6346048712730408, "grad_norm": 11.39375114440918, "learning_rate": 6.379310344827587e-07, "num_tokens": 769519.0, "completions/mean_length": 189.625, "completions/min_length": 107.0, "completions/max_length": 252.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 189.625, "completions/min_terminated_length": 107.0, "completions/max_terminated_length": 252.0, "tools/call_frequency": 4.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0116192027926445, "sampling/sampling_logp_difference/max": 0.501544713973999, "sampling/importance_sampling_ratio/min": 0.48311614990234375, "sampling/importance_sampling_ratio/mean": 1.121081829071045, "sampling/importance_sampling_ratio/max": 2.3119733333587646, "entropy": 0.4275653772056103, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.685825224965811, "epoch": 0.0030208333333333333, "step": 116 }, { "loss": 0.275103360414505, "grad_norm": 6.650213241577148, "learning_rate": 6.344827586206897e-07, "num_tokens": 776222.0, "completions/mean_length": 152.5, "completions/min_length": 69.0, "completions/max_length": 226.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 152.5, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 226.0, "tools/call_frequency": 3.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009626222774386406, "sampling/sampling_logp_difference/max": 0.37070217728614807, "sampling/importance_sampling_ratio/min": 0.7094672322273254, "sampling/importance_sampling_ratio/mean": 0.9113250374794006, "sampling/importance_sampling_ratio/max": 1.0302008390426636, "entropy": 0.3465727660804987, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.282361835241318, "epoch": 0.003046875, "step": 117 }, { "loss": 0.5156227946281433, "grad_norm": 12.00820541381836, "learning_rate": 6.310344827586207e-07, "num_tokens": 783016.0, "completions/mean_length": 163.375, "completions/min_length": 68.0, "completions/max_length": 305.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 163.375, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 305.0, "tools/call_frequency": 3.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010941405780613422, "sampling/sampling_logp_difference/max": 0.33629274368286133, "sampling/importance_sampling_ratio/min": 0.671073317527771, "sampling/importance_sampling_ratio/mean": 1.1759719848632812, "sampling/importance_sampling_ratio/max": 2.6716582775115967, "entropy": 0.37467433512210846, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.680275987833738, "epoch": 0.0030729166666666665, "step": 118 }, { "loss": 0.8407106995582581, "grad_norm": 17.85860824584961, "learning_rate": 6.275862068965517e-07, "num_tokens": 789604.0, "completions/mean_length": 138.375, "completions/min_length": 69.0, "completions/max_length": 214.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 138.375, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 214.0, "tools/call_frequency": 3.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.007618207484483719, "sampling/sampling_logp_difference/max": 0.5025027990341187, "sampling/importance_sampling_ratio/min": 1.04802668094635, "sampling/importance_sampling_ratio/mean": 1.4295008182525635, "sampling/importance_sampling_ratio/max": 2.82423996925354, "entropy": 0.27158435992896557, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.559630651026964, "epoch": 0.0030989583333333333, "step": 119 }, { "loss": 0.2827949821949005, "grad_norm": 8.021854400634766, "learning_rate": 6.241379310344828e-07, "num_tokens": 796059.0, "completions/mean_length": 120.25, "completions/min_length": 68.0, "completions/max_length": 213.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 120.25, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 213.0, "tools/call_frequency": 2.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010789177380502224, "sampling/sampling_logp_difference/max": 0.340850830078125, "sampling/importance_sampling_ratio/min": 0.5744712352752686, "sampling/importance_sampling_ratio/mean": 1.0135583877563477, "sampling/importance_sampling_ratio/max": 1.5326063632965088, "entropy": 0.31681070290505886, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.3704073913395405, "epoch": 0.003125, "step": 120 }, { "loss": -0.025903521105647087, "grad_norm": 4.59657096862793, "learning_rate": 6.206896551724138e-07, "num_tokens": 802505.0, "completions/mean_length": 120.75, "completions/min_length": 67.0, "completions/max_length": 221.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 120.75, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 221.0, "tools/call_frequency": 2.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008937821723520756, "sampling/sampling_logp_difference/max": 0.2381293773651123, "sampling/importance_sampling_ratio/min": 0.4230496287345886, "sampling/importance_sampling_ratio/mean": 0.9173972010612488, "sampling/importance_sampling_ratio/max": 1.2072618007659912, "entropy": 0.2807257492095232, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.378578908741474, "epoch": 0.0031510416666666666, "step": 121 }, { "loss": 0.26725050806999207, "grad_norm": 6.32208776473999, "learning_rate": 6.172413793103448e-07, "num_tokens": 809156.0, "completions/mean_length": 145.875, "completions/min_length": 68.0, "completions/max_length": 221.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 145.875, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 221.0, "tools/call_frequency": 3.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.00852217711508274, "sampling/sampling_logp_difference/max": 0.32854509353637695, "sampling/importance_sampling_ratio/min": 0.7225236892700195, "sampling/importance_sampling_ratio/mean": 1.0455591678619385, "sampling/importance_sampling_ratio/max": 1.5532008409500122, "entropy": 0.3005763553082943, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.43068253621459, "epoch": 0.0031770833333333334, "step": 122 }, { "loss": 0.4808719754219055, "grad_norm": 8.258113861083984, "learning_rate": 6.137931034482758e-07, "num_tokens": 815806.0, "completions/mean_length": 145.625, "completions/min_length": 71.0, "completions/max_length": 243.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 145.625, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 243.0, "tools/call_frequency": 3.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008157098665833473, "sampling/sampling_logp_difference/max": 0.22320938110351562, "sampling/importance_sampling_ratio/min": 0.7562220096588135, "sampling/importance_sampling_ratio/mean": 1.136099100112915, "sampling/importance_sampling_ratio/max": 1.8109313249588013, "entropy": 0.2966256979852915, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.4172316417098045, "epoch": 0.003203125, "step": 123 }, { "loss": 0.5732248425483704, "grad_norm": 16.379390716552734, "learning_rate": 6.103448275862068e-07, "num_tokens": 822109.0, "completions/mean_length": 102.125, "completions/min_length": 68.0, "completions/max_length": 224.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 102.125, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 224.0, "tools/call_frequency": 2.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008749508298933506, "sampling/sampling_logp_difference/max": 0.25598084926605225, "sampling/importance_sampling_ratio/min": 0.639359712600708, "sampling/importance_sampling_ratio/mean": 0.9943200349807739, "sampling/importance_sampling_ratio/max": 1.2689450979232788, "entropy": 0.30843711271882057, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.309287916868925, "epoch": 0.0032291666666666666, "step": 124 }, { "loss": 0.4618254005908966, "grad_norm": 10.676800727844238, "learning_rate": 6.068965517241379e-07, "num_tokens": 828772.0, "completions/mean_length": 147.0, "completions/min_length": 69.0, "completions/max_length": 262.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 147.0, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 262.0, "tools/call_frequency": 3.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010596249252557755, "sampling/sampling_logp_difference/max": 0.7496117353439331, "sampling/importance_sampling_ratio/min": 0.4353272616863251, "sampling/importance_sampling_ratio/mean": 0.9691989421844482, "sampling/importance_sampling_ratio/max": 1.589128851890564, "entropy": 0.3156683165580034, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.325103811919689, "epoch": 0.0032552083333333335, "step": 125 }, { "loss": 0.1790747195482254, "grad_norm": 4.7959370613098145, "learning_rate": 6.03448275862069e-07, "num_tokens": 835526.0, "completions/mean_length": 158.75, "completions/min_length": 70.0, "completions/max_length": 248.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 158.75, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 248.0, "tools/call_frequency": 3.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01063541229814291, "sampling/sampling_logp_difference/max": 0.22961997985839844, "sampling/importance_sampling_ratio/min": 0.3773084282875061, "sampling/importance_sampling_ratio/mean": 0.825863778591156, "sampling/importance_sampling_ratio/max": 1.1119177341461182, "entropy": 0.3437854181975126, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.781949814409018, "epoch": 0.00328125, "step": 126 }, { "loss": 0.23551371693611145, "grad_norm": 6.73379373550415, "learning_rate": 6e-07, "num_tokens": 842385.0, "completions/mean_length": 172.125, "completions/min_length": 67.0, "completions/max_length": 260.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 172.125, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 260.0, "tools/call_frequency": 4.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011370385065674782, "sampling/sampling_logp_difference/max": 0.405911922454834, "sampling/importance_sampling_ratio/min": 0.30566754937171936, "sampling/importance_sampling_ratio/mean": 0.9301817417144775, "sampling/importance_sampling_ratio/max": 1.3651103973388672, "entropy": 0.346507778391242, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.910211618989706, "epoch": 0.0033072916666666667, "step": 127 }, { "loss": 0.2022474855184555, "grad_norm": 5.945463180541992, "learning_rate": 5.96551724137931e-07, "num_tokens": 849044.0, "completions/mean_length": 147.0, "completions/min_length": 69.0, "completions/max_length": 265.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 147.0, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 265.0, "tools/call_frequency": 3.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010776746086776257, "sampling/sampling_logp_difference/max": 0.23667407035827637, "sampling/importance_sampling_ratio/min": 0.6757450103759766, "sampling/importance_sampling_ratio/mean": 0.9513915181159973, "sampling/importance_sampling_ratio/max": 1.2933709621429443, "entropy": 0.38165279291570187, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.643797766417265, "epoch": 0.0033333333333333335, "step": 128 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 5.93103448275862e-07, "num_tokens": 855708.0, "completions/mean_length": 146.75, "completions/min_length": 67.0, "completions/max_length": 242.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 146.75, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 242.0, "tools/call_frequency": 3.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.0092051662504673, "sampling/sampling_logp_difference/max": 0.3924950361251831, "sampling/importance_sampling_ratio/min": 0.6075559258460999, "sampling/importance_sampling_ratio/mean": 0.9896328449249268, "sampling/importance_sampling_ratio/max": 1.5017863512039185, "entropy": 0.3463828284293413, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.5251744240522385, "epoch": 0.003359375, "step": 129 }, { "loss": 0.38643378019332886, "grad_norm": 6.654504299163818, "learning_rate": 5.89655172413793e-07, "num_tokens": 862511.0, "completions/mean_length": 164.875, "completions/min_length": 83.0, "completions/max_length": 235.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 164.875, "completions/min_terminated_length": 83.0, "completions/max_terminated_length": 235.0, "tools/call_frequency": 4.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010791948065161705, "sampling/sampling_logp_difference/max": 0.23099565505981445, "sampling/importance_sampling_ratio/min": 0.41067779064178467, "sampling/importance_sampling_ratio/mean": 0.9913187026977539, "sampling/importance_sampling_ratio/max": 1.4988288879394531, "entropy": 0.39549149572849274, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.7824774123728275, "epoch": 0.0033854166666666668, "step": 130 }, { "loss": 0.22039467096328735, "grad_norm": 6.21829080581665, "learning_rate": 5.86206896551724e-07, "num_tokens": 869214.0, "completions/mean_length": 152.875, "completions/min_length": 69.0, "completions/max_length": 249.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 152.875, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 249.0, "tools/call_frequency": 3.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010067283175885677, "sampling/sampling_logp_difference/max": 0.3524649143218994, "sampling/importance_sampling_ratio/min": 0.480991929769516, "sampling/importance_sampling_ratio/mean": 0.9281871318817139, "sampling/importance_sampling_ratio/max": 1.4045127630233765, "entropy": 0.3497322015464306, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.732268910855055, "epoch": 0.003411458333333333, "step": 131 }, { "loss": -0.0316716805100441, "grad_norm": 9.690140724182129, "learning_rate": 5.827586206896552e-07, "num_tokens": 876082.0, "completions/mean_length": 172.875, "completions/min_length": 67.0, "completions/max_length": 261.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 172.875, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 261.0, "tools/call_frequency": 4.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010459067299962044, "sampling/sampling_logp_difference/max": 0.5119318962097168, "sampling/importance_sampling_ratio/min": 0.6052589416503906, "sampling/importance_sampling_ratio/mean": 1.2895135879516602, "sampling/importance_sampling_ratio/max": 2.734208106994629, "entropy": 0.35428342036902905, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.711316466331482, "epoch": 0.0034375, "step": 132 }, { "loss": 0.08035942912101746, "grad_norm": 5.704185962677002, "learning_rate": 5.793103448275862e-07, "num_tokens": 882364.0, "completions/mean_length": 99.75, "completions/min_length": 65.0, "completions/max_length": 218.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 99.75, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 218.0, "tools/call_frequency": 2.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011121845804154873, "sampling/sampling_logp_difference/max": 0.3112626075744629, "sampling/importance_sampling_ratio/min": 0.4699535369873047, "sampling/importance_sampling_ratio/mean": 0.8771479725837708, "sampling/importance_sampling_ratio/max": 1.2009285688400269, "entropy": 0.29472543112933636, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.868767715990543, "epoch": 0.003463541666666667, "step": 133 }, { "loss": 0.3339073061943054, "grad_norm": 8.164704322814941, "learning_rate": 5.758620689655173e-07, "num_tokens": 889143.0, "completions/mean_length": 161.0, "completions/min_length": 69.0, "completions/max_length": 269.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 161.0, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 269.0, "tools/call_frequency": 3.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01054984051734209, "sampling/sampling_logp_difference/max": 0.24594974517822266, "sampling/importance_sampling_ratio/min": 0.6299041509628296, "sampling/importance_sampling_ratio/mean": 1.0245990753173828, "sampling/importance_sampling_ratio/max": 1.4536675214767456, "entropy": 0.3493700586259365, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.682643141597509, "epoch": 0.0034895833333333333, "step": 134 }, { "loss": 0.8844559788703918, "grad_norm": 9.89760971069336, "learning_rate": 5.724137931034483e-07, "num_tokens": 895864.0, "completions/mean_length": 153.5, "completions/min_length": 70.0, "completions/max_length": 252.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 153.5, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 252.0, "tools/call_frequency": 3.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011449676938354969, "sampling/sampling_logp_difference/max": 0.38788652420043945, "sampling/importance_sampling_ratio/min": 0.88230299949646, "sampling/importance_sampling_ratio/mean": 1.2738628387451172, "sampling/importance_sampling_ratio/max": 2.109377145767212, "entropy": 0.3731806166470051, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.541810233145952, "epoch": 0.003515625, "step": 135 }, { "loss": 0.13434669375419617, "grad_norm": 5.815131664276123, "learning_rate": 5.689655172413793e-07, "num_tokens": 902263.0, "completions/mean_length": 113.375, "completions/min_length": 70.0, "completions/max_length": 211.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 113.375, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 211.0, "tools/call_frequency": 2.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012074402533471584, "sampling/sampling_logp_difference/max": 0.28097081184387207, "sampling/importance_sampling_ratio/min": 0.48622947931289673, "sampling/importance_sampling_ratio/mean": 0.8854970932006836, "sampling/importance_sampling_ratio/max": 1.2359530925750732, "entropy": 0.3264181297272444, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.367224920541048, "epoch": 0.0035416666666666665, "step": 136 }, { "loss": 0.07884258776903152, "grad_norm": 7.055483341217041, "learning_rate": 5.655172413793103e-07, "num_tokens": 908765.0, "completions/mean_length": 126.625, "completions/min_length": 71.0, "completions/max_length": 272.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 126.625, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 272.0, "tools/call_frequency": 2.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011616985313594341, "sampling/sampling_logp_difference/max": 0.29666805267333984, "sampling/importance_sampling_ratio/min": 0.5381214618682861, "sampling/importance_sampling_ratio/mean": 0.9300821423530579, "sampling/importance_sampling_ratio/max": 1.3228057622909546, "entropy": 0.4124498013406992, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.391462463885546, "epoch": 0.0035677083333333333, "step": 137 }, { "loss": 0.6435405611991882, "grad_norm": 11.429481506347656, "learning_rate": 5.620689655172414e-07, "num_tokens": 915381.0, "completions/mean_length": 141.125, "completions/min_length": 71.0, "completions/max_length": 275.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 141.125, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 275.0, "tools/call_frequency": 2.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01192566379904747, "sampling/sampling_logp_difference/max": 0.3008649945259094, "sampling/importance_sampling_ratio/min": 0.6619023084640503, "sampling/importance_sampling_ratio/mean": 1.0313981771469116, "sampling/importance_sampling_ratio/max": 1.6887017488479614, "entropy": 0.3635614365339279, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.4945810325443745, "epoch": 0.00359375, "step": 138 }, { "loss": 0.4657299518585205, "grad_norm": 6.181362628936768, "learning_rate": 5.586206896551724e-07, "num_tokens": 922244.0, "completions/mean_length": 171.875, "completions/min_length": 69.0, "completions/max_length": 327.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 171.875, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 327.0, "tools/call_frequency": 3.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010941163636744022, "sampling/sampling_logp_difference/max": 0.22705680131912231, "sampling/importance_sampling_ratio/min": 0.537858784198761, "sampling/importance_sampling_ratio/mean": 0.8851903676986694, "sampling/importance_sampling_ratio/max": 1.3793160915374756, "entropy": 0.38550532795488834, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.107820358127356, "epoch": 0.0036197916666666666, "step": 139 }, { "loss": -0.10473527014255524, "grad_norm": 5.893695831298828, "learning_rate": 5.551724137931034e-07, "num_tokens": 928940.0, "completions/mean_length": 151.625, "completions/min_length": 67.0, "completions/max_length": 242.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 151.625, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 242.0, "tools/call_frequency": 3.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.036250002682209015, "rewards/reward_func/std": 0.019955307245254517, "reward": 0.036250002682209015, "reward_std": 0.019955307245254517, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011792115867137909, "sampling/sampling_logp_difference/max": 0.6515421867370605, "sampling/importance_sampling_ratio/min": 0.13460567593574524, "sampling/importance_sampling_ratio/mean": 0.863896369934082, "sampling/importance_sampling_ratio/max": 1.2930536270141602, "entropy": 0.4071816857904196, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.9469256810843945, "epoch": 0.0036458333333333334, "step": 140 }, { "loss": 0.36559128761291504, "grad_norm": 7.0739874839782715, "learning_rate": 5.517241379310344e-07, "num_tokens": 935635.0, "completions/mean_length": 150.75, "completions/min_length": 77.0, "completions/max_length": 244.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 150.75, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 244.0, "tools/call_frequency": 3.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012012180872261524, "sampling/sampling_logp_difference/max": 0.8238973617553711, "sampling/importance_sampling_ratio/min": 0.551522433757782, "sampling/importance_sampling_ratio/mean": 0.9712069630622864, "sampling/importance_sampling_ratio/max": 1.5781205892562866, "entropy": 0.3758638817816973, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.235336318612099, "epoch": 0.003671875, "step": 141 }, { "loss": 0.5909204483032227, "grad_norm": 10.78104019165039, "learning_rate": 5.482758620689654e-07, "num_tokens": 942039.0, "completions/mean_length": 115.125, "completions/min_length": 68.0, "completions/max_length": 221.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 115.125, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 221.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009524553082883358, "sampling/sampling_logp_difference/max": 0.34715771675109863, "sampling/importance_sampling_ratio/min": 0.7241600751876831, "sampling/importance_sampling_ratio/mean": 1.020354151725769, "sampling/importance_sampling_ratio/max": 1.5488468408584595, "entropy": 0.3125888742506504, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.358454208821058, "epoch": 0.0036979166666666666, "step": 142 }, { "loss": 0.371610552072525, "grad_norm": 9.44663143157959, "learning_rate": 5.448275862068966e-07, "num_tokens": 948420.0, "completions/mean_length": 111.5, "completions/min_length": 69.0, "completions/max_length": 223.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 111.5, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 223.0, "tools/call_frequency": 2.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010900081135332584, "sampling/sampling_logp_difference/max": 0.23548507690429688, "sampling/importance_sampling_ratio/min": 0.6133748888969421, "sampling/importance_sampling_ratio/mean": 0.877676248550415, "sampling/importance_sampling_ratio/max": 1.3901312351226807, "entropy": 0.34686912782490253, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.447076119482517, "epoch": 0.0037239583333333335, "step": 143 }, { "loss": 0.5922117233276367, "grad_norm": 13.413734436035156, "learning_rate": 5.413793103448276e-07, "num_tokens": 955037.0, "completions/mean_length": 141.25, "completions/min_length": 68.0, "completions/max_length": 365.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 141.25, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 365.0, "tools/call_frequency": 2.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01297376025468111, "sampling/sampling_logp_difference/max": 0.23618745803833008, "sampling/importance_sampling_ratio/min": 0.3555481731891632, "sampling/importance_sampling_ratio/mean": 1.0578644275665283, "sampling/importance_sampling_ratio/max": 1.6765522956848145, "entropy": 0.39507456310093403, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.79993000254035, "epoch": 0.00375, "step": 144 }, { "loss": 0.23630912601947784, "grad_norm": 5.603333473205566, "learning_rate": 5.379310344827586e-07, "num_tokens": 961729.0, "completions/mean_length": 151.125, "completions/min_length": 76.0, "completions/max_length": 236.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 151.125, "completions/min_terminated_length": 76.0, "completions/max_terminated_length": 236.0, "tools/call_frequency": 3.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010452363640069962, "sampling/sampling_logp_difference/max": 0.6782970428466797, "sampling/importance_sampling_ratio/min": 0.2544386088848114, "sampling/importance_sampling_ratio/mean": 0.8308250904083252, "sampling/importance_sampling_ratio/max": 1.352867603302002, "entropy": 0.35167958959937096, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.475310180336237, "epoch": 0.0037760416666666667, "step": 145 }, { "loss": -0.1252993643283844, "grad_norm": 5.965582370758057, "learning_rate": 5.344827586206896e-07, "num_tokens": 968330.0, "completions/mean_length": 139.625, "completions/min_length": 68.0, "completions/max_length": 231.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 139.625, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 231.0, "tools/call_frequency": 2.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010536031797528267, "sampling/sampling_logp_difference/max": 0.22926044464111328, "sampling/importance_sampling_ratio/min": 0.33621829748153687, "sampling/importance_sampling_ratio/mean": 1.0802295207977295, "sampling/importance_sampling_ratio/max": 1.9177711009979248, "entropy": 0.4332877267152071, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.348659306764603, "epoch": 0.0038020833333333335, "step": 146 }, { "loss": 0.2816794216632843, "grad_norm": 10.91917896270752, "learning_rate": 5.310344827586206e-07, "num_tokens": 975025.0, "completions/mean_length": 151.25, "completions/min_length": 72.0, "completions/max_length": 220.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 151.25, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 220.0, "tools/call_frequency": 3.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011163009330630302, "sampling/sampling_logp_difference/max": 0.27510547637939453, "sampling/importance_sampling_ratio/min": 0.7145137190818787, "sampling/importance_sampling_ratio/mean": 1.2337570190429688, "sampling/importance_sampling_ratio/max": 2.066477060317993, "entropy": 0.3741652797907591, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.513817120343447, "epoch": 0.003828125, "step": 147 }, { "loss": 0.15150494873523712, "grad_norm": 4.9359049797058105, "learning_rate": 5.275862068965517e-07, "num_tokens": 981809.0, "completions/mean_length": 161.875, "completions/min_length": 70.0, "completions/max_length": 241.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 161.875, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 241.0, "tools/call_frequency": 3.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526474453508854, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009888200089335442, "sampling/sampling_logp_difference/max": 0.18794631958007812, "sampling/importance_sampling_ratio/min": 0.5370185971260071, "sampling/importance_sampling_ratio/mean": 0.8451970815658569, "sampling/importance_sampling_ratio/max": 1.2252720594406128, "entropy": 0.3730885051190853, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.422040428966284, "epoch": 0.0038541666666666668, "step": 148 }, { "loss": 0.03353673964738846, "grad_norm": 5.289402961730957, "learning_rate": 5.241379310344828e-07, "num_tokens": 988166.0, "completions/mean_length": 109.0, "completions/min_length": 69.0, "completions/max_length": 253.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 109.0, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 253.0, "tools/call_frequency": 2.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009996372275054455, "sampling/sampling_logp_difference/max": 0.24192500114440918, "sampling/importance_sampling_ratio/min": 0.37206289172172546, "sampling/importance_sampling_ratio/mean": 0.9003746509552002, "sampling/importance_sampling_ratio/max": 1.3345550298690796, "entropy": 0.3364357128739357, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.124768618494272, "epoch": 0.003880208333333333, "step": 149 }, { "loss": 0.4561821520328522, "grad_norm": 5.345966339111328, "learning_rate": 5.206896551724138e-07, "num_tokens": 995306.0, "completions/mean_length": 207.25, "completions/min_length": 72.0, "completions/max_length": 310.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 207.25, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 310.0, "tools/call_frequency": 4.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03125, "rewards/reward_func/std": 0.015526474453508854, "reward": 0.03125, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013141309842467308, "sampling/sampling_logp_difference/max": 0.2841451168060303, "sampling/importance_sampling_ratio/min": 0.4366952180862427, "sampling/importance_sampling_ratio/mean": 0.9153301119804382, "sampling/importance_sampling_ratio/max": 1.668927550315857, "entropy": 0.45230007730424404, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.826663624495268, "epoch": 0.00390625, "step": 150 }, { "loss": 0.11600668728351593, "grad_norm": 5.187719821929932, "learning_rate": 5.172413793103448e-07, "num_tokens": 1002074.0, "completions/mean_length": 159.625, "completions/min_length": 74.0, "completions/max_length": 228.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 159.625, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 228.0, "tools/call_frequency": 3.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010474211536347866, "sampling/sampling_logp_difference/max": 0.22877717018127441, "sampling/importance_sampling_ratio/min": 0.41867905855178833, "sampling/importance_sampling_ratio/mean": 0.7981000542640686, "sampling/importance_sampling_ratio/max": 1.3060157299041748, "entropy": 0.3814409375190735, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.408076927065849, "epoch": 0.003932291666666666, "step": 151 }, { "loss": 0.22497065365314484, "grad_norm": 9.38429069519043, "learning_rate": 5.137931034482759e-07, "num_tokens": 1008519.0, "completions/mean_length": 120.625, "completions/min_length": 77.0, "completions/max_length": 254.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 120.625, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 254.0, "tools/call_frequency": 2.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01106168981641531, "sampling/sampling_logp_difference/max": 0.46137118339538574, "sampling/importance_sampling_ratio/min": 0.6133219599723816, "sampling/importance_sampling_ratio/mean": 0.981549859046936, "sampling/importance_sampling_ratio/max": 1.3719937801361084, "entropy": 0.3602590449154377, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.429544303566217, "epoch": 0.003958333333333334, "step": 152 }, { "loss": 0.14659032225608826, "grad_norm": 4.5607805252075195, "learning_rate": 5.103448275862069e-07, "num_tokens": 1015204.0, "completions/mean_length": 149.625, "completions/min_length": 67.0, "completions/max_length": 239.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 149.625, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 239.0, "tools/call_frequency": 3.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01044460292905569, "sampling/sampling_logp_difference/max": 0.23629188537597656, "sampling/importance_sampling_ratio/min": 0.43308189511299133, "sampling/importance_sampling_ratio/mean": 0.6988573670387268, "sampling/importance_sampling_ratio/max": 1.0475229024887085, "entropy": 0.38442783057689667, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.722482580691576, "epoch": 0.003984375, "step": 153 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 5.068965517241379e-07, "num_tokens": 1021642.0, "completions/mean_length": 119.25, "completions/min_length": 75.0, "completions/max_length": 185.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 119.25, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 185.0, "tools/call_frequency": 2.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.010814960114657879, "sampling/sampling_logp_difference/max": 0.2301645278930664, "sampling/importance_sampling_ratio/min": 0.6734923720359802, "sampling/importance_sampling_ratio/mean": 1.030893325805664, "sampling/importance_sampling_ratio/max": 1.6214594841003418, "entropy": 0.37780166044831276, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.066457532346249, "epoch": 0.0040104166666666665, "step": 154 }, { "loss": 0.09276268631219864, "grad_norm": 6.388376235961914, "learning_rate": 5.03448275862069e-07, "num_tokens": 1028042.0, "completions/mean_length": 114.25, "completions/min_length": 69.0, "completions/max_length": 199.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 114.25, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 199.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008938313461840153, "sampling/sampling_logp_difference/max": 0.35042858123779297, "sampling/importance_sampling_ratio/min": 0.7779285311698914, "sampling/importance_sampling_ratio/mean": 1.13539457321167, "sampling/importance_sampling_ratio/max": 1.635698914527893, "entropy": 0.3467178996652365, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.420503478497267, "epoch": 0.004036458333333334, "step": 155 }, { "loss": 0.30706319212913513, "grad_norm": 7.921052932739258, "learning_rate": 5e-07, "num_tokens": 1034644.0, "completions/mean_length": 138.125, "completions/min_length": 64.0, "completions/max_length": 236.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 138.125, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 236.0, "tools/call_frequency": 3.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009582938626408577, "sampling/sampling_logp_difference/max": 0.2107241153717041, "sampling/importance_sampling_ratio/min": 0.9497532248497009, "sampling/importance_sampling_ratio/mean": 1.1179430484771729, "sampling/importance_sampling_ratio/max": 1.4074989557266235, "entropy": 0.3807706218212843, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.399908613413572, "epoch": 0.0040625, "step": 156 }, { "loss": 0.15914547443389893, "grad_norm": 8.622142791748047, "learning_rate": 4.96551724137931e-07, "num_tokens": 1041147.0, "completions/mean_length": 127.5, "completions/min_length": 74.0, "completions/max_length": 263.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 127.5, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 263.0, "tools/call_frequency": 2.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010321034118533134, "sampling/sampling_logp_difference/max": 0.2393045425415039, "sampling/importance_sampling_ratio/min": 0.5923110246658325, "sampling/importance_sampling_ratio/mean": 1.0897908210754395, "sampling/importance_sampling_ratio/max": 1.5215054750442505, "entropy": 0.34646858647465706, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.144720334559679, "epoch": 0.0040885416666666665, "step": 157 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 4.93103448275862e-07, "num_tokens": 1047377.0, "completions/mean_length": 92.625, "completions/min_length": 66.0, "completions/max_length": 224.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 92.625, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 224.0, "tools/call_frequency": 1.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.011111222207546234, "sampling/sampling_logp_difference/max": 0.23401474952697754, "sampling/importance_sampling_ratio/min": 0.596598744392395, "sampling/importance_sampling_ratio/mean": 1.0669481754302979, "sampling/importance_sampling_ratio/max": 1.743268370628357, "entropy": 0.3270287439227104, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.059169597923756, "epoch": 0.004114583333333333, "step": 158 }, { "loss": 0.8481175899505615, "grad_norm": 14.032878875732422, "learning_rate": 4.89655172413793e-07, "num_tokens": 1054176.0, "completions/mean_length": 164.375, "completions/min_length": 71.0, "completions/max_length": 262.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 164.375, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 262.0, "tools/call_frequency": 3.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013288868591189384, "sampling/sampling_logp_difference/max": 0.2288370132446289, "sampling/importance_sampling_ratio/min": 0.660346269607544, "sampling/importance_sampling_ratio/mean": 1.1337367296218872, "sampling/importance_sampling_ratio/max": 2.779522657394409, "entropy": 0.43657696805894375, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.542712081223726, "epoch": 0.004140625, "step": 159 }, { "loss": 0.2928353548049927, "grad_norm": 6.743988990783691, "learning_rate": 4.86206896551724e-07, "num_tokens": 1060751.0, "completions/mean_length": 135.125, "completions/min_length": 68.0, "completions/max_length": 225.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 135.125, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 225.0, "tools/call_frequency": 3.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526474453508854, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01074211299419403, "sampling/sampling_logp_difference/max": 0.29061341285705566, "sampling/importance_sampling_ratio/min": 0.701608419418335, "sampling/importance_sampling_ratio/mean": 0.9121615886688232, "sampling/importance_sampling_ratio/max": 1.264937162399292, "entropy": 0.37345817871391773, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.707511655986309, "epoch": 0.004166666666666667, "step": 160 }, { "loss": 0.27348294854164124, "grad_norm": 8.389760971069336, "learning_rate": 4.827586206896552e-07, "num_tokens": 1067521.0, "completions/mean_length": 160.5, "completions/min_length": 69.0, "completions/max_length": 253.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 160.5, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 253.0, "tools/call_frequency": 3.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012955406680703163, "sampling/sampling_logp_difference/max": 0.30843019485473633, "sampling/importance_sampling_ratio/min": 0.3167129158973694, "sampling/importance_sampling_ratio/mean": 0.9492311477661133, "sampling/importance_sampling_ratio/max": 1.5266128778457642, "entropy": 0.4168580323457718, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.507475238293409, "epoch": 0.004192708333333333, "step": 161 }, { "loss": 0.46580934524536133, "grad_norm": 12.362199783325195, "learning_rate": 4.793103448275862e-07, "num_tokens": 1074312.0, "completions/mean_length": 162.875, "completions/min_length": 68.0, "completions/max_length": 315.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 162.875, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 315.0, "tools/call_frequency": 3.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01365566160529852, "sampling/sampling_logp_difference/max": 0.23987793922424316, "sampling/importance_sampling_ratio/min": 0.451067715883255, "sampling/importance_sampling_ratio/mean": 1.221800446510315, "sampling/importance_sampling_ratio/max": 2.9149608612060547, "entropy": 0.4211210086941719, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.599305208772421, "epoch": 0.00421875, "step": 162 }, { "loss": 0.7719423770904541, "grad_norm": 11.908933639526367, "learning_rate": 4.7586206896551725e-07, "num_tokens": 1080890.0, "completions/mean_length": 136.75, "completions/min_length": 68.0, "completions/max_length": 267.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 136.75, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 267.0, "tools/call_frequency": 2.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011187504976987839, "sampling/sampling_logp_difference/max": 0.22979331016540527, "sampling/importance_sampling_ratio/min": 0.7769345045089722, "sampling/importance_sampling_ratio/mean": 1.0808329582214355, "sampling/importance_sampling_ratio/max": 1.9545265436172485, "entropy": 0.3350531365722418, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.403560355305672, "epoch": 0.004244791666666667, "step": 163 }, { "loss": -0.023511650040745735, "grad_norm": 4.579489707946777, "learning_rate": 4.7241379310344827e-07, "num_tokens": 1087506.0, "completions/mean_length": 141.0, "completions/min_length": 82.0, "completions/max_length": 214.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 141.0, "completions/min_terminated_length": 82.0, "completions/max_terminated_length": 214.0, "tools/call_frequency": 3.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009542525745928288, "sampling/sampling_logp_difference/max": 0.25358736515045166, "sampling/importance_sampling_ratio/min": 0.5355388522148132, "sampling/importance_sampling_ratio/mean": 0.9319785833358765, "sampling/importance_sampling_ratio/max": 1.3638423681259155, "entropy": 0.3927879575639963, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.409089520573616, "epoch": 0.004270833333333333, "step": 164 }, { "loss": 0.6146892309188843, "grad_norm": 11.655983924865723, "learning_rate": 4.689655172413793e-07, "num_tokens": 1093951.0, "completions/mean_length": 119.375, "completions/min_length": 69.0, "completions/max_length": 271.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 119.375, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 271.0, "tools/call_frequency": 2.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0130855618044734, "sampling/sampling_logp_difference/max": 0.3415532112121582, "sampling/importance_sampling_ratio/min": 0.6998491883277893, "sampling/importance_sampling_ratio/mean": 0.9789403080940247, "sampling/importance_sampling_ratio/max": 1.2991653680801392, "entropy": 0.35031095892190933, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.084268372505903, "epoch": 0.004296875, "step": 165 }, { "loss": 0.2628885805606842, "grad_norm": 9.257012367248535, "learning_rate": 4.655172413793103e-07, "num_tokens": 1100277.0, "completions/mean_length": 105.0, "completions/min_length": 66.0, "completions/max_length": 248.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 105.0, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 248.0, "tools/call_frequency": 2.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011025010608136654, "sampling/sampling_logp_difference/max": 0.4657559394836426, "sampling/importance_sampling_ratio/min": 0.6272523999214172, "sampling/importance_sampling_ratio/mean": 0.9330089092254639, "sampling/importance_sampling_ratio/max": 1.1947609186172485, "entropy": 0.3005186766386032, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.44056111946702, "epoch": 0.004322916666666667, "step": 166 }, { "loss": 0.3473038375377655, "grad_norm": 11.237125396728516, "learning_rate": 4.620689655172413e-07, "num_tokens": 1107273.0, "completions/mean_length": 188.625, "completions/min_length": 71.0, "completions/max_length": 290.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 188.625, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 290.0, "tools/call_frequency": 4.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011958522722125053, "sampling/sampling_logp_difference/max": 0.2396981120109558, "sampling/importance_sampling_ratio/min": 0.5938199758529663, "sampling/importance_sampling_ratio/mean": 1.2082080841064453, "sampling/importance_sampling_ratio/max": 2.1477696895599365, "entropy": 0.43346363492310047, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.647990759462118, "epoch": 0.004348958333333333, "step": 167 }, { "loss": 0.375881552696228, "grad_norm": 11.231345176696777, "learning_rate": 4.586206896551724e-07, "num_tokens": 1113930.0, "completions/mean_length": 146.875, "completions/min_length": 72.0, "completions/max_length": 309.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 146.875, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 309.0, "tools/call_frequency": 2.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012398858554661274, "sampling/sampling_logp_difference/max": 0.35318946838378906, "sampling/importance_sampling_ratio/min": 0.592577338218689, "sampling/importance_sampling_ratio/mean": 0.9523167610168457, "sampling/importance_sampling_ratio/max": 1.5916956663131714, "entropy": 0.36419576592743397, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.841407876461744, "epoch": 0.004375, "step": 168 }, { "loss": 0.369973361492157, "grad_norm": 8.31087589263916, "learning_rate": 4.5517241379310346e-07, "num_tokens": 1120637.0, "completions/mean_length": 152.5, "completions/min_length": 71.0, "completions/max_length": 271.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 152.5, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 271.0, "tools/call_frequency": 3.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01190831046551466, "sampling/sampling_logp_difference/max": 0.24907875061035156, "sampling/importance_sampling_ratio/min": 0.6186512112617493, "sampling/importance_sampling_ratio/mean": 0.9450300931930542, "sampling/importance_sampling_ratio/max": 1.15328049659729, "entropy": 0.38446491956710815, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.545520156621933, "epoch": 0.004401041666666667, "step": 169 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 4.5172413793103447e-07, "num_tokens": 1126989.0, "completions/mean_length": 107.875, "completions/min_length": 67.0, "completions/max_length": 212.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 107.875, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 212.0, "tools/call_frequency": 2.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.009688830934464931, "sampling/sampling_logp_difference/max": 0.21934986114501953, "sampling/importance_sampling_ratio/min": 0.568965494632721, "sampling/importance_sampling_ratio/mean": 1.0050801038742065, "sampling/importance_sampling_ratio/max": 1.726969838142395, "entropy": 0.345406549051404, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.232211943715811, "epoch": 0.004427083333333333, "step": 170 }, { "loss": 0.0018211621791124344, "grad_norm": 3.5631000995635986, "learning_rate": 4.482758620689655e-07, "num_tokens": 1133588.0, "completions/mean_length": 138.5, "completions/min_length": 80.0, "completions/max_length": 247.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 138.5, "completions/min_terminated_length": 80.0, "completions/max_terminated_length": 247.0, "tools/call_frequency": 2.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012644898146390915, "sampling/sampling_logp_difference/max": 0.3246300220489502, "sampling/importance_sampling_ratio/min": 0.3674854636192322, "sampling/importance_sampling_ratio/mean": 0.6914317011833191, "sampling/importance_sampling_ratio/max": 1.0202902555465698, "entropy": 0.4186480715870857, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.439485292881727, "epoch": 0.004453125, "step": 171 }, { "loss": 0.23380541801452637, "grad_norm": 7.386971950531006, "learning_rate": 4.4482758620689656e-07, "num_tokens": 1140145.0, "completions/mean_length": 134.25, "completions/min_length": 57.0, "completions/max_length": 248.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 134.25, "completions/min_terminated_length": 57.0, "completions/max_terminated_length": 248.0, "tools/call_frequency": 2.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010394912213087082, "sampling/sampling_logp_difference/max": 0.23205900192260742, "sampling/importance_sampling_ratio/min": 0.6111149787902832, "sampling/importance_sampling_ratio/mean": 1.074774146080017, "sampling/importance_sampling_ratio/max": 1.4737930297851562, "entropy": 0.40662066638469696, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.4265474528074265, "epoch": 0.004479166666666667, "step": 172 }, { "loss": 0.2922966778278351, "grad_norm": 7.548577308654785, "learning_rate": 4.413793103448276e-07, "num_tokens": 1146698.0, "completions/mean_length": 133.75, "completions/min_length": 68.0, "completions/max_length": 225.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 133.75, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 225.0, "tools/call_frequency": 3.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0100996233522892, "sampling/sampling_logp_difference/max": 0.24335050582885742, "sampling/importance_sampling_ratio/min": 0.8184927701950073, "sampling/importance_sampling_ratio/mean": 1.0778617858886719, "sampling/importance_sampling_ratio/max": 1.5109097957611084, "entropy": 0.34739658795297146, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.289377816021442, "epoch": 0.004505208333333333, "step": 173 }, { "loss": -0.11277288943529129, "grad_norm": 6.575459957122803, "learning_rate": 4.379310344827586e-07, "num_tokens": 1152977.0, "completions/mean_length": 99.875, "completions/min_length": 71.0, "completions/max_length": 209.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 99.875, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 209.0, "tools/call_frequency": 1.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011082465760409832, "sampling/sampling_logp_difference/max": 0.8528811931610107, "sampling/importance_sampling_ratio/min": 0.2814207077026367, "sampling/importance_sampling_ratio/mean": 0.7343454360961914, "sampling/importance_sampling_ratio/max": 1.3050929307937622, "entropy": 0.3079978320747614, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.172449450939894, "epoch": 0.00453125, "step": 174 }, { "loss": 0.25698673725128174, "grad_norm": 6.957929611206055, "learning_rate": 4.344827586206896e-07, "num_tokens": 1159541.0, "completions/mean_length": 135.125, "completions/min_length": 68.0, "completions/max_length": 260.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 135.125, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 260.0, "tools/call_frequency": 2.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011162425391376019, "sampling/sampling_logp_difference/max": 0.20833706855773926, "sampling/importance_sampling_ratio/min": 0.45818760991096497, "sampling/importance_sampling_ratio/mean": 0.869988739490509, "sampling/importance_sampling_ratio/max": 1.1792570352554321, "entropy": 0.3767632134258747, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.697212811559439, "epoch": 0.004557291666666667, "step": 175 }, { "loss": 0.8612809181213379, "grad_norm": 16.8394832611084, "learning_rate": 4.310344827586206e-07, "num_tokens": 1166375.0, "completions/mean_length": 169.0, "completions/min_length": 99.0, "completions/max_length": 267.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 169.0, "completions/min_terminated_length": 99.0, "completions/max_terminated_length": 267.0, "tools/call_frequency": 3.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010630536824464798, "sampling/sampling_logp_difference/max": 0.27670979499816895, "sampling/importance_sampling_ratio/min": 0.7076943516731262, "sampling/importance_sampling_ratio/mean": 1.3311774730682373, "sampling/importance_sampling_ratio/max": 2.9949889183044434, "entropy": 0.4005416538566351, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.0489320158958435, "epoch": 0.004583333333333333, "step": 176 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 4.2758620689655174e-07, "num_tokens": 1172554.0, "completions/mean_length": 86.75, "completions/min_length": 67.0, "completions/max_length": 184.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 86.75, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 184.0, "tools/call_frequency": 1.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.01007942296564579, "sampling/sampling_logp_difference/max": 0.19375240802764893, "sampling/importance_sampling_ratio/min": 0.7981061339378357, "sampling/importance_sampling_ratio/mean": 0.9341230392456055, "sampling/importance_sampling_ratio/max": 1.1046969890594482, "entropy": 0.28836890682578087, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 3.929526772350073, "epoch": 0.004609375, "step": 177 }, { "loss": 0.05435868725180626, "grad_norm": 5.189301490783691, "learning_rate": 4.2413793103448276e-07, "num_tokens": 1178983.0, "completions/mean_length": 117.75, "completions/min_length": 71.0, "completions/max_length": 193.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 117.75, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 193.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008957152254879475, "sampling/sampling_logp_difference/max": 0.2768409252166748, "sampling/importance_sampling_ratio/min": 0.5556984543800354, "sampling/importance_sampling_ratio/mean": 0.7904459238052368, "sampling/importance_sampling_ratio/max": 0.9727844595909119, "entropy": 0.3666645549237728, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.392410054802895, "epoch": 0.004635416666666667, "step": 178 }, { "loss": -0.08780400454998016, "grad_norm": 8.182136535644531, "learning_rate": 4.206896551724138e-07, "num_tokens": 1185599.0, "completions/mean_length": 141.75, "completions/min_length": 63.0, "completions/max_length": 209.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 141.75, "completions/min_terminated_length": 63.0, "completions/max_terminated_length": 209.0, "tools/call_frequency": 3.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.00987004954367876, "sampling/sampling_logp_difference/max": 0.2421727180480957, "sampling/importance_sampling_ratio/min": 0.3975090980529785, "sampling/importance_sampling_ratio/mean": 1.002042293548584, "sampling/importance_sampling_ratio/max": 1.966546893119812, "entropy": 0.42018814384937286, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.668474476784468, "epoch": 0.004661458333333333, "step": 179 }, { "loss": 0.6045021414756775, "grad_norm": 15.846688270568848, "learning_rate": 4.172413793103448e-07, "num_tokens": 1191903.0, "completions/mean_length": 102.5, "completions/min_length": 70.0, "completions/max_length": 219.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 102.5, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 219.0, "tools/call_frequency": 2.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008791572414338589, "sampling/sampling_logp_difference/max": 0.33843231201171875, "sampling/importance_sampling_ratio/min": 0.6387788653373718, "sampling/importance_sampling_ratio/mean": 1.055454969406128, "sampling/importance_sampling_ratio/max": 1.326087474822998, "entropy": 0.3026501890271902, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.579355504363775, "epoch": 0.0046875, "step": 180 }, { "loss": 1.1409872770309448, "grad_norm": 21.891529083251953, "learning_rate": 4.1379310344827586e-07, "num_tokens": 1198568.0, "completions/mean_length": 147.25, "completions/min_length": 69.0, "completions/max_length": 293.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 147.25, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 293.0, "tools/call_frequency": 2.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011778594925999641, "sampling/sampling_logp_difference/max": 0.1832127571105957, "sampling/importance_sampling_ratio/min": 0.7818493247032166, "sampling/importance_sampling_ratio/mean": 1.3314809799194336, "sampling/importance_sampling_ratio/max": 2.8407533168792725, "entropy": 0.39793164283037186, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.6309323608875275, "epoch": 0.004713541666666667, "step": 181 }, { "loss": 0.30127936601638794, "grad_norm": 5.057689189910889, "learning_rate": 4.103448275862069e-07, "num_tokens": 1205479.0, "completions/mean_length": 178.125, "completions/min_length": 74.0, "completions/max_length": 250.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 178.125, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 250.0, "tools/call_frequency": 4.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03125, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.03125, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011917045339941978, "sampling/sampling_logp_difference/max": 0.23945236206054688, "sampling/importance_sampling_ratio/min": 0.6173256635665894, "sampling/importance_sampling_ratio/mean": 0.9075149297714233, "sampling/importance_sampling_ratio/max": 1.1264578104019165, "entropy": 0.44140035286545753, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.923307754099369, "epoch": 0.0047395833333333335, "step": 182 }, { "loss": 0.34322789311408997, "grad_norm": 8.49929428100586, "learning_rate": 4.068965517241379e-07, "num_tokens": 1211849.0, "completions/mean_length": 110.125, "completions/min_length": 60.0, "completions/max_length": 203.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 110.125, "completions/min_terminated_length": 60.0, "completions/max_terminated_length": 203.0, "tools/call_frequency": 2.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010291483253240585, "sampling/sampling_logp_difference/max": 0.24012541770935059, "sampling/importance_sampling_ratio/min": 0.5971702933311462, "sampling/importance_sampling_ratio/mean": 0.964635968208313, "sampling/importance_sampling_ratio/max": 1.112904667854309, "entropy": 0.391786839812994, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.570714749395847, "epoch": 0.004765625, "step": 183 }, { "loss": 0.16904284060001373, "grad_norm": 9.5955171585083, "learning_rate": 4.034482758620689e-07, "num_tokens": 1218678.0, "completions/mean_length": 167.625, "completions/min_length": 76.0, "completions/max_length": 241.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 167.625, "completions/min_terminated_length": 76.0, "completions/max_terminated_length": 241.0, "tools/call_frequency": 4.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012972831726074219, "sampling/sampling_logp_difference/max": 0.24413681030273438, "sampling/importance_sampling_ratio/min": 0.6339846849441528, "sampling/importance_sampling_ratio/mean": 1.1767498254776, "sampling/importance_sampling_ratio/max": 1.939034104347229, "entropy": 0.39454277232289314, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.918307833373547, "epoch": 0.004791666666666666, "step": 184 }, { "loss": -0.0006056800484657288, "grad_norm": 12.325313568115234, "learning_rate": 4e-07, "num_tokens": 1224965.0, "completions/mean_length": 99.875, "completions/min_length": 33.0, "completions/max_length": 275.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 99.875, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 275.0, "tools/call_frequency": 1.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03375000134110451, "rewards/reward_func/std": 0.023260941728949547, "reward": 0.03375000134110451, "reward_std": 0.023260943591594696, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012283585965633392, "sampling/sampling_logp_difference/max": 0.4999208450317383, "sampling/importance_sampling_ratio/min": 0.9127498269081116, "sampling/importance_sampling_ratio/mean": 1.2342811822891235, "sampling/importance_sampling_ratio/max": 1.8924020528793335, "entropy": 0.39068141765892506, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.626852199435234, "epoch": 0.0048177083333333336, "step": 185 }, { "loss": 0.07842296361923218, "grad_norm": 6.335314750671387, "learning_rate": 3.9655172413793105e-07, "num_tokens": 1231534.0, "completions/mean_length": 135.375, "completions/min_length": 67.0, "completions/max_length": 264.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 135.375, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 264.0, "tools/call_frequency": 2.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012935163453221321, "sampling/sampling_logp_difference/max": 0.20404204726219177, "sampling/importance_sampling_ratio/min": 0.4006340503692627, "sampling/importance_sampling_ratio/mean": 0.9868682622909546, "sampling/importance_sampling_ratio/max": 1.386427402496338, "entropy": 0.41527734510600567, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.903137322515249, "epoch": 0.00484375, "step": 186 }, { "loss": 0.11629949510097504, "grad_norm": 5.789632797241211, "learning_rate": 3.9310344827586207e-07, "num_tokens": 1238023.0, "completions/mean_length": 125.75, "completions/min_length": 75.0, "completions/max_length": 250.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 125.75, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 250.0, "tools/call_frequency": 2.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01072772592306137, "sampling/sampling_logp_difference/max": 0.2597615718841553, "sampling/importance_sampling_ratio/min": 0.339815616607666, "sampling/importance_sampling_ratio/mean": 0.8379199504852295, "sampling/importance_sampling_ratio/max": 1.291773796081543, "entropy": 0.37690404057502747, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.60603829100728, "epoch": 0.004869791666666666, "step": 187 }, { "loss": 0.3735130727291107, "grad_norm": 10.981667518615723, "learning_rate": 3.896551724137931e-07, "num_tokens": 1244409.0, "completions/mean_length": 112.125, "completions/min_length": 66.0, "completions/max_length": 228.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 112.125, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 228.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010385327972471714, "sampling/sampling_logp_difference/max": 0.5025007724761963, "sampling/importance_sampling_ratio/min": 0.4661784768104553, "sampling/importance_sampling_ratio/mean": 0.9296875, "sampling/importance_sampling_ratio/max": 1.2577831745147705, "entropy": 0.355515418574214, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.957318779081106, "epoch": 0.004895833333333334, "step": 188 }, { "loss": 0.21311049163341522, "grad_norm": 6.727203369140625, "learning_rate": 3.862068965517241e-07, "num_tokens": 1251057.0, "completions/mean_length": 145.25, "completions/min_length": 74.0, "completions/max_length": 263.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 145.25, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 263.0, "tools/call_frequency": 2.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012884154915809631, "sampling/sampling_logp_difference/max": 0.38040757179260254, "sampling/importance_sampling_ratio/min": 0.5787162184715271, "sampling/importance_sampling_ratio/mean": 0.8488845825195312, "sampling/importance_sampling_ratio/max": 1.2245104312896729, "entropy": 0.42780186235904694, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.5089960135519505, "epoch": 0.004921875, "step": 189 }, { "loss": 0.6590151190757751, "grad_norm": 14.280123710632324, "learning_rate": 3.827586206896551e-07, "num_tokens": 1257511.0, "completions/mean_length": 120.0, "completions/min_length": 77.0, "completions/max_length": 236.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 120.0, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 236.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011502846144139767, "sampling/sampling_logp_difference/max": 0.30818653106689453, "sampling/importance_sampling_ratio/min": 0.5623441934585571, "sampling/importance_sampling_ratio/mean": 0.9922210574150085, "sampling/importance_sampling_ratio/max": 1.4878226518630981, "entropy": 0.3852516859769821, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.386795286089182, "epoch": 0.0049479166666666664, "step": 190 }, { "loss": 0.38144803047180176, "grad_norm": 10.913237571716309, "learning_rate": 3.793103448275862e-07, "num_tokens": 1264237.0, "completions/mean_length": 155.5, "completions/min_length": 85.0, "completions/max_length": 260.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 155.5, "completions/min_terminated_length": 85.0, "completions/max_terminated_length": 260.0, "tools/call_frequency": 3.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012909011915326118, "sampling/sampling_logp_difference/max": 0.2953941822052002, "sampling/importance_sampling_ratio/min": 0.461484432220459, "sampling/importance_sampling_ratio/mean": 1.0771204233169556, "sampling/importance_sampling_ratio/max": 1.5659905672073364, "entropy": 0.44374576583504677, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.805965360254049, "epoch": 0.004973958333333334, "step": 191 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 3.758620689655172e-07, "num_tokens": 1270399.0, "completions/mean_length": 83.875, "completions/min_length": 72.0, "completions/max_length": 117.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 83.875, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 117.0, "tools/call_frequency": 1.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.011835743673145771, "sampling/sampling_logp_difference/max": 0.2230854034423828, "sampling/importance_sampling_ratio/min": 0.45591768622398376, "sampling/importance_sampling_ratio/mean": 0.8939676880836487, "sampling/importance_sampling_ratio/max": 1.3621009588241577, "entropy": 0.38288533315062523, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 3.9766218550503254, "epoch": 0.005, "step": 192 }, { "loss": 0.056972865015268326, "grad_norm": 5.35400915145874, "learning_rate": 3.7241379310344827e-07, "num_tokens": 1276976.0, "completions/mean_length": 136.625, "completions/min_length": 77.0, "completions/max_length": 275.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 136.625, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 275.0, "tools/call_frequency": 2.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011981626972556114, "sampling/sampling_logp_difference/max": 0.244032621383667, "sampling/importance_sampling_ratio/min": 0.44053128361701965, "sampling/importance_sampling_ratio/mean": 0.7978172898292542, "sampling/importance_sampling_ratio/max": 1.0736907720565796, "entropy": 0.4474455751478672, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.814843371510506, "epoch": 0.0050260416666666665, "step": 193 }, { "loss": 0.016485296189785004, "grad_norm": 7.252522945404053, "learning_rate": 3.689655172413793e-07, "num_tokens": 1283648.0, "completions/mean_length": 148.125, "completions/min_length": 70.0, "completions/max_length": 260.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 148.125, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 260.0, "tools/call_frequency": 3.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012578821741044521, "sampling/sampling_logp_difference/max": 0.23240303993225098, "sampling/importance_sampling_ratio/min": 0.8274345993995667, "sampling/importance_sampling_ratio/mean": 1.1455323696136475, "sampling/importance_sampling_ratio/max": 1.6724406480789185, "entropy": 0.4318423978984356, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.095242727547884, "epoch": 0.005052083333333333, "step": 194 }, { "loss": 0.6880623698234558, "grad_norm": 16.694412231445312, "learning_rate": 3.6551724137931036e-07, "num_tokens": 1290314.0, "completions/mean_length": 147.25, "completions/min_length": 71.0, "completions/max_length": 238.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 147.25, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 238.0, "tools/call_frequency": 3.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012899965047836304, "sampling/sampling_logp_difference/max": 0.3462080955505371, "sampling/importance_sampling_ratio/min": 0.4847384989261627, "sampling/importance_sampling_ratio/mean": 1.084380865097046, "sampling/importance_sampling_ratio/max": 1.9770784378051758, "entropy": 0.4202742390334606, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.784683238714933, "epoch": 0.005078125, "step": 195 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 3.620689655172414e-07, "num_tokens": 1296967.0, "completions/mean_length": 145.875, "completions/min_length": 78.0, "completions/max_length": 285.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 145.875, "completions/min_terminated_length": 78.0, "completions/max_terminated_length": 285.0, "tools/call_frequency": 2.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.012529930099844933, "sampling/sampling_logp_difference/max": 0.24443650245666504, "sampling/importance_sampling_ratio/min": 0.5624415874481201, "sampling/importance_sampling_ratio/mean": 0.8213838338851929, "sampling/importance_sampling_ratio/max": 1.0986772775650024, "entropy": 0.42567526921629906, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.492628771811724, "epoch": 0.005104166666666667, "step": 196 }, { "loss": 0.45965296030044556, "grad_norm": 8.655374526977539, "learning_rate": 3.586206896551724e-07, "num_tokens": 1303611.0, "completions/mean_length": 144.25, "completions/min_length": 69.0, "completions/max_length": 267.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 144.25, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 267.0, "tools/call_frequency": 3.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011928001418709755, "sampling/sampling_logp_difference/max": 0.22033953666687012, "sampling/importance_sampling_ratio/min": 0.5027190446853638, "sampling/importance_sampling_ratio/mean": 0.8887758851051331, "sampling/importance_sampling_ratio/max": 1.3258726596832275, "entropy": 0.46588760428130627, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.284952130168676, "epoch": 0.005130208333333333, "step": 197 }, { "loss": 0.18497925996780396, "grad_norm": 7.559632301330566, "learning_rate": 3.551724137931034e-07, "num_tokens": 1310215.0, "completions/mean_length": 139.625, "completions/min_length": 70.0, "completions/max_length": 247.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 139.625, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 247.0, "tools/call_frequency": 2.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012348986230790615, "sampling/sampling_logp_difference/max": 0.27898216247558594, "sampling/importance_sampling_ratio/min": 0.5253216624259949, "sampling/importance_sampling_ratio/mean": 0.7854946255683899, "sampling/importance_sampling_ratio/max": 0.8735929131507874, "entropy": 0.45491900481283665, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.465506013482809, "epoch": 0.00515625, "step": 198 }, { "loss": -0.08935487270355225, "grad_norm": 6.127851486206055, "learning_rate": 3.517241379310344e-07, "num_tokens": 1316936.0, "completions/mean_length": 153.875, "completions/min_length": 69.0, "completions/max_length": 247.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 153.875, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 247.0, "tools/call_frequency": 3.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012517875991761684, "sampling/sampling_logp_difference/max": 0.24907398223876953, "sampling/importance_sampling_ratio/min": 0.4286423623561859, "sampling/importance_sampling_ratio/mean": 0.9874168038368225, "sampling/importance_sampling_ratio/max": 2.276364326477051, "entropy": 0.44687318429350853, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.690568562597036, "epoch": 0.005182291666666667, "step": 199 }, { "loss": 0.9141201972961426, "grad_norm": 16.405120849609375, "learning_rate": 3.482758620689655e-07, "num_tokens": 1323391.0, "completions/mean_length": 121.625, "completions/min_length": 68.0, "completions/max_length": 251.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 121.625, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 251.0, "tools/call_frequency": 2.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012842261232435703, "sampling/sampling_logp_difference/max": 0.2057645320892334, "sampling/importance_sampling_ratio/min": 0.46204623579978943, "sampling/importance_sampling_ratio/mean": 0.9734433889389038, "sampling/importance_sampling_ratio/max": 1.8341413736343384, "entropy": 0.3637054245918989, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.475969448685646, "epoch": 0.005208333333333333, "step": 200 }, { "loss": 0.9453942775726318, "grad_norm": 17.104549407958984, "learning_rate": 3.4482758620689656e-07, "num_tokens": 1329885.0, "completions/mean_length": 125.5, "completions/min_length": 70.0, "completions/max_length": 237.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 125.5, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 237.0, "tools/call_frequency": 2.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01111309602856636, "sampling/sampling_logp_difference/max": 0.30436182022094727, "sampling/importance_sampling_ratio/min": 0.9285438656806946, "sampling/importance_sampling_ratio/mean": 1.2504147291183472, "sampling/importance_sampling_ratio/max": 2.410783052444458, "entropy": 0.3642578963190317, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.403528522700071, "epoch": 0.005234375, "step": 201 }, { "loss": 0.21054492890834808, "grad_norm": 9.34546184539795, "learning_rate": 3.413793103448276e-07, "num_tokens": 1336420.0, "completions/mean_length": 130.5, "completions/min_length": 68.0, "completions/max_length": 298.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 130.5, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 298.0, "tools/call_frequency": 2.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011648633517324924, "sampling/sampling_logp_difference/max": 0.23357868194580078, "sampling/importance_sampling_ratio/min": 0.24158550798892975, "sampling/importance_sampling_ratio/mean": 1.0925474166870117, "sampling/importance_sampling_ratio/max": 2.336683511734009, "entropy": 0.4032603092491627, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.478457719087601, "epoch": 0.005260416666666667, "step": 202 }, { "loss": 0.279621958732605, "grad_norm": 9.959053993225098, "learning_rate": 3.379310344827586e-07, "num_tokens": 1343049.0, "completions/mean_length": 142.5, "completions/min_length": 74.0, "completions/max_length": 242.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 142.5, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 242.0, "tools/call_frequency": 3.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011681344360113144, "sampling/sampling_logp_difference/max": 0.21847867965698242, "sampling/importance_sampling_ratio/min": 0.6201596856117249, "sampling/importance_sampling_ratio/mean": 1.168886661529541, "sampling/importance_sampling_ratio/max": 2.254486083984375, "entropy": 0.3999029342085123, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.769645597785711, "epoch": 0.005286458333333333, "step": 203 }, { "loss": -0.11037106812000275, "grad_norm": 5.849955081939697, "learning_rate": 3.3448275862068966e-07, "num_tokens": 1349865.0, "completions/mean_length": 166.0, "completions/min_length": 78.0, "completions/max_length": 277.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 166.0, "completions/min_terminated_length": 78.0, "completions/max_terminated_length": 277.0, "tools/call_frequency": 3.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526474453508854, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012746571563184261, "sampling/sampling_logp_difference/max": 0.24169301986694336, "sampling/importance_sampling_ratio/min": 0.32824668288230896, "sampling/importance_sampling_ratio/mean": 0.8333212733268738, "sampling/importance_sampling_ratio/max": 1.310794472694397, "entropy": 0.498266514390707, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.253634586930275, "epoch": 0.0053125, "step": 204 }, { "loss": 0.3719358742237091, "grad_norm": 11.291912078857422, "learning_rate": 3.310344827586207e-07, "num_tokens": 1356449.0, "completions/mean_length": 137.0, "completions/min_length": 72.0, "completions/max_length": 283.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 137.0, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 283.0, "tools/call_frequency": 2.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01213235966861248, "sampling/sampling_logp_difference/max": 0.2695298194885254, "sampling/importance_sampling_ratio/min": 0.3053126335144043, "sampling/importance_sampling_ratio/mean": 0.8756632208824158, "sampling/importance_sampling_ratio/max": 1.4020564556121826, "entropy": 0.40571884252130985, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.380243666470051, "epoch": 0.005338541666666667, "step": 205 }, { "loss": 0.13082677125930786, "grad_norm": 6.490048408508301, "learning_rate": 3.275862068965517e-07, "num_tokens": 1362935.0, "completions/mean_length": 123.125, "completions/min_length": 69.0, "completions/max_length": 223.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 123.125, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 223.0, "tools/call_frequency": 2.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01020714733749628, "sampling/sampling_logp_difference/max": 0.2975800037384033, "sampling/importance_sampling_ratio/min": 0.7269694805145264, "sampling/importance_sampling_ratio/mean": 0.9220360517501831, "sampling/importance_sampling_ratio/max": 1.108488917350769, "entropy": 0.3558282647281885, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.2529863603413105, "epoch": 0.005364583333333333, "step": 206 }, { "loss": 0.7816362380981445, "grad_norm": 17.64269256591797, "learning_rate": 3.241379310344827e-07, "num_tokens": 1369267.0, "completions/mean_length": 105.75, "completions/min_length": 70.0, "completions/max_length": 223.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 105.75, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 223.0, "tools/call_frequency": 2.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011245619505643845, "sampling/sampling_logp_difference/max": 0.21663975715637207, "sampling/importance_sampling_ratio/min": 0.9651802182197571, "sampling/importance_sampling_ratio/mean": 1.3807144165039062, "sampling/importance_sampling_ratio/max": 2.6575331687927246, "entropy": 0.3583196084946394, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.310196924954653, "epoch": 0.005390625, "step": 207 }, { "loss": 0.40571242570877075, "grad_norm": 12.48848819732666, "learning_rate": 3.2068965517241373e-07, "num_tokens": 1375565.0, "completions/mean_length": 101.625, "completions/min_length": 66.0, "completions/max_length": 239.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 101.625, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 239.0, "tools/call_frequency": 1.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009595691226422787, "sampling/sampling_logp_difference/max": 0.3749361038208008, "sampling/importance_sampling_ratio/min": 0.8002716302871704, "sampling/importance_sampling_ratio/mean": 0.9763150215148926, "sampling/importance_sampling_ratio/max": 1.2989428043365479, "entropy": 0.32817674800753593, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.5159632712602615, "epoch": 0.005416666666666667, "step": 208 }, { "loss": 0.5767332911491394, "grad_norm": 11.465566635131836, "learning_rate": 3.1724137931034485e-07, "num_tokens": 1382229.0, "completions/mean_length": 146.75, "completions/min_length": 68.0, "completions/max_length": 265.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 146.75, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 265.0, "tools/call_frequency": 3.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011839838698506355, "sampling/sampling_logp_difference/max": 0.5961899757385254, "sampling/importance_sampling_ratio/min": 0.5625261664390564, "sampling/importance_sampling_ratio/mean": 1.1063092947006226, "sampling/importance_sampling_ratio/max": 1.7667672634124756, "entropy": 0.4060604628175497, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.446445610374212, "epoch": 0.005442708333333333, "step": 209 }, { "loss": -0.23488286137580872, "grad_norm": 2.3821659088134766, "learning_rate": 3.1379310344827587e-07, "num_tokens": 1388637.0, "completions/mean_length": 115.25, "completions/min_length": 72.0, "completions/max_length": 251.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 115.25, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 251.0, "tools/call_frequency": 2.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012368322350084782, "sampling/sampling_logp_difference/max": 0.2108621597290039, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.8220264315605164, "sampling/importance_sampling_ratio/max": 1.2257623672485352, "entropy": 0.39095643907785416, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.334742747247219, "epoch": 0.00546875, "step": 210 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 3.103448275862069e-07, "num_tokens": 1395151.0, "completions/mean_length": 128.875, "completions/min_length": 69.0, "completions/max_length": 308.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 128.875, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 308.0, "tools/call_frequency": 2.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.012848781421780586, "sampling/sampling_logp_difference/max": 0.33110857009887695, "sampling/importance_sampling_ratio/min": 0.6424484848976135, "sampling/importance_sampling_ratio/mean": 1.02729332447052, "sampling/importance_sampling_ratio/max": 2.2100915908813477, "entropy": 0.3777618892490864, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.429770581424236, "epoch": 0.005494791666666667, "step": 211 }, { "loss": 0.15680256485939026, "grad_norm": 11.032898902893066, "learning_rate": 3.068965517241379e-07, "num_tokens": 1402050.0, "completions/mean_length": 176.75, "completions/min_length": 93.0, "completions/max_length": 285.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 176.75, "completions/min_terminated_length": 93.0, "completions/max_terminated_length": 285.0, "tools/call_frequency": 3.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013004615902900696, "sampling/sampling_logp_difference/max": 0.23497986793518066, "sampling/importance_sampling_ratio/min": 0.694526731967926, "sampling/importance_sampling_ratio/mean": 1.2747150659561157, "sampling/importance_sampling_ratio/max": 2.4309091567993164, "entropy": 0.4759202115237713, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.89239677041769, "epoch": 0.005520833333333333, "step": 212 }, { "loss": 0.3323233723640442, "grad_norm": 7.215777397155762, "learning_rate": 3.0344827586206897e-07, "num_tokens": 1409168.0, "completions/mean_length": 204.125, "completions/min_length": 77.0, "completions/max_length": 297.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 204.125, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 297.0, "tools/call_frequency": 4.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.016089437529444695, "sampling/sampling_logp_difference/max": 0.28532445430755615, "sampling/importance_sampling_ratio/min": 0.7036678791046143, "sampling/importance_sampling_ratio/mean": 1.0391933917999268, "sampling/importance_sampling_ratio/max": 1.47321355342865, "entropy": 0.5410622581839561, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.559695336967707, "epoch": 0.005546875, "step": 213 }, { "loss": 0.23397217690944672, "grad_norm": 5.875241756439209, "learning_rate": 3e-07, "num_tokens": 1415976.0, "completions/mean_length": 165.375, "completions/min_length": 67.0, "completions/max_length": 258.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 165.375, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 258.0, "tools/call_frequency": 3.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011345112696290016, "sampling/sampling_logp_difference/max": 0.1864471435546875, "sampling/importance_sampling_ratio/min": 0.4188888370990753, "sampling/importance_sampling_ratio/mean": 0.9156566858291626, "sampling/importance_sampling_ratio/max": 1.3792855739593506, "entropy": 0.4403095841407776, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.581337206065655, "epoch": 0.005572916666666667, "step": 214 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 2.96551724137931e-07, "num_tokens": 1422231.0, "completions/mean_length": 95.875, "completions/min_length": 69.0, "completions/max_length": 213.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 95.875, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 213.0, "tools/call_frequency": 1.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.010533266700804234, "sampling/sampling_logp_difference/max": 0.25306034088134766, "sampling/importance_sampling_ratio/min": 0.5759313106536865, "sampling/importance_sampling_ratio/mean": 0.8588753938674927, "sampling/importance_sampling_ratio/max": 1.0917410850524902, "entropy": 0.3255910091102123, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.091893520206213, "epoch": 0.005598958333333333, "step": 215 }, { "loss": 0.32778310775756836, "grad_norm": 10.576912879943848, "learning_rate": 2.93103448275862e-07, "num_tokens": 1428644.0, "completions/mean_length": 115.5, "completions/min_length": 69.0, "completions/max_length": 237.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 115.5, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 237.0, "tools/call_frequency": 2.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01138492301106453, "sampling/sampling_logp_difference/max": 0.24492597579956055, "sampling/importance_sampling_ratio/min": 0.524755597114563, "sampling/importance_sampling_ratio/mean": 0.9320729374885559, "sampling/importance_sampling_ratio/max": 1.35755455493927, "entropy": 0.37721105106174946, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.260284721851349, "epoch": 0.005625, "step": 216 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 2.896551724137931e-07, "num_tokens": 1435057.0, "completions/mean_length": 116.125, "completions/min_length": 65.0, "completions/max_length": 251.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 116.125, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 251.0, "tools/call_frequency": 1.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.012136752717196941, "sampling/sampling_logp_difference/max": 0.23023200035095215, "sampling/importance_sampling_ratio/min": 0.40735483169555664, "sampling/importance_sampling_ratio/mean": 0.9149947166442871, "sampling/importance_sampling_ratio/max": 1.4666075706481934, "entropy": 0.4278120342642069, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.436994034796953, "epoch": 0.005651041666666667, "step": 217 }, { "loss": 0.06301713734865189, "grad_norm": 8.017706871032715, "learning_rate": 2.8620689655172416e-07, "num_tokens": 1441547.0, "completions/mean_length": 124.625, "completions/min_length": 73.0, "completions/max_length": 279.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 124.625, "completions/min_terminated_length": 73.0, "completions/max_terminated_length": 279.0, "tools/call_frequency": 2.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013832253403961658, "sampling/sampling_logp_difference/max": 0.32451510429382324, "sampling/importance_sampling_ratio/min": 0.5127649903297424, "sampling/importance_sampling_ratio/mean": 1.092328429222107, "sampling/importance_sampling_ratio/max": 1.518818974494934, "entropy": 0.43027937039732933, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.3908355087041855, "epoch": 0.0056770833333333335, "step": 218 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 2.827586206896552e-07, "num_tokens": 1448105.0, "completions/mean_length": 133.875, "completions/min_length": 68.0, "completions/max_length": 221.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 133.875, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 221.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.01342255063354969, "sampling/sampling_logp_difference/max": 0.27190732955932617, "sampling/importance_sampling_ratio/min": 0.7653844952583313, "sampling/importance_sampling_ratio/mean": 1.0253962278366089, "sampling/importance_sampling_ratio/max": 1.3865551948547363, "entropy": 0.45285717211663723, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.378151454031467, "epoch": 0.005703125, "step": 219 }, { "loss": 0.5095319747924805, "grad_norm": 11.815544128417969, "learning_rate": 2.793103448275862e-07, "num_tokens": 1454882.0, "completions/mean_length": 161.25, "completions/min_length": 67.0, "completions/max_length": 313.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 161.25, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 313.0, "tools/call_frequency": 3.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.014361303299665451, "sampling/sampling_logp_difference/max": 0.3563472032546997, "sampling/importance_sampling_ratio/min": 0.3937526047229767, "sampling/importance_sampling_ratio/mean": 0.906612753868103, "sampling/importance_sampling_ratio/max": 1.582302451133728, "entropy": 0.4475947581231594, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.597413223236799, "epoch": 0.005729166666666666, "step": 220 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 2.758620689655172e-07, "num_tokens": 1461490.0, "completions/mean_length": 139.875, "completions/min_length": 80.0, "completions/max_length": 254.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 139.875, "completions/min_terminated_length": 80.0, "completions/max_terminated_length": 254.0, "tools/call_frequency": 2.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.012968702241778374, "sampling/sampling_logp_difference/max": 0.38468262553215027, "sampling/importance_sampling_ratio/min": 0.36424314975738525, "sampling/importance_sampling_ratio/mean": 0.691200852394104, "sampling/importance_sampling_ratio/max": 1.1632012128829956, "entropy": 0.4124142676591873, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.133171293884516, "epoch": 0.0057552083333333335, "step": 221 }, { "loss": 0.19329620897769928, "grad_norm": 6.358828544616699, "learning_rate": 2.724137931034483e-07, "num_tokens": 1468411.0, "completions/mean_length": 179.25, "completions/min_length": 86.0, "completions/max_length": 261.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 179.25, "completions/min_terminated_length": 86.0, "completions/max_terminated_length": 261.0, "tools/call_frequency": 3.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01195982750505209, "sampling/sampling_logp_difference/max": 0.21186542510986328, "sampling/importance_sampling_ratio/min": 0.6114763617515564, "sampling/importance_sampling_ratio/mean": 0.8549631834030151, "sampling/importance_sampling_ratio/max": 1.1557800769805908, "entropy": 0.4751623086631298, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.601303726434708, "epoch": 0.00578125, "step": 222 }, { "loss": 0.597856342792511, "grad_norm": 11.19804859161377, "learning_rate": 2.689655172413793e-07, "num_tokens": 1475019.0, "completions/mean_length": 140.125, "completions/min_length": 77.0, "completions/max_length": 251.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 140.125, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 251.0, "tools/call_frequency": 2.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.014490770176053047, "sampling/sampling_logp_difference/max": 0.4966411590576172, "sampling/importance_sampling_ratio/min": 0.2947727143764496, "sampling/importance_sampling_ratio/mean": 0.9278420209884644, "sampling/importance_sampling_ratio/max": 1.7858716249465942, "entropy": 0.4526561126112938, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.656230702996254, "epoch": 0.005807291666666666, "step": 223 }, { "loss": 0.5293675661087036, "grad_norm": 10.959287643432617, "learning_rate": 2.655172413793103e-07, "num_tokens": 1482018.0, "completions/mean_length": 188.875, "completions/min_length": 88.0, "completions/max_length": 308.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 188.875, "completions/min_terminated_length": 88.0, "completions/max_terminated_length": 308.0, "tools/call_frequency": 3.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.015520632266998291, "sampling/sampling_logp_difference/max": 0.4545530080795288, "sampling/importance_sampling_ratio/min": 0.26863721013069153, "sampling/importance_sampling_ratio/mean": 1.010183334350586, "sampling/importance_sampling_ratio/max": 2.2065470218658447, "entropy": 0.5238443687558174, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.02837996929884, "epoch": 0.005833333333333334, "step": 224 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 2.620689655172414e-07, "num_tokens": 1488407.0, "completions/mean_length": 113.375, "completions/min_length": 72.0, "completions/max_length": 274.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 113.375, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 274.0, "tools/call_frequency": 1.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.011422202922403812, "sampling/sampling_logp_difference/max": 0.18252670764923096, "sampling/importance_sampling_ratio/min": 0.781724750995636, "sampling/importance_sampling_ratio/mean": 1.1000239849090576, "sampling/importance_sampling_ratio/max": 1.876916527748108, "entropy": 0.3653805945068598, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.194482043385506, "epoch": 0.005859375, "step": 225 }, { "loss": 0.3485426902770996, "grad_norm": 7.607486248016357, "learning_rate": 2.586206896551724e-07, "num_tokens": 1494959.0, "completions/mean_length": 133.375, "completions/min_length": 71.0, "completions/max_length": 279.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 133.375, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 279.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011195224709808826, "sampling/sampling_logp_difference/max": 0.35314178466796875, "sampling/importance_sampling_ratio/min": 0.5968507528305054, "sampling/importance_sampling_ratio/mean": 0.9407460689544678, "sampling/importance_sampling_ratio/max": 1.2945661544799805, "entropy": 0.4079206567257643, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.4857202507555485, "epoch": 0.005885416666666666, "step": 226 }, { "loss": -0.20471936464309692, "grad_norm": 5.693267345428467, "learning_rate": 2.5517241379310346e-07, "num_tokens": 1501562.0, "completions/mean_length": 139.375, "completions/min_length": 71.0, "completions/max_length": 247.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 139.375, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 247.0, "tools/call_frequency": 2.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013582213781774044, "sampling/sampling_logp_difference/max": 0.4022789001464844, "sampling/importance_sampling_ratio/min": 0.4726339876651764, "sampling/importance_sampling_ratio/mean": 1.0938546657562256, "sampling/importance_sampling_ratio/max": 2.6664717197418213, "entropy": 0.47337841987609863, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.482229553163052, "epoch": 0.005911458333333334, "step": 227 }, { "loss": 0.33710193634033203, "grad_norm": 11.913230895996094, "learning_rate": 2.517241379310345e-07, "num_tokens": 1507937.0, "completions/mean_length": 110.875, "completions/min_length": 67.0, "completions/max_length": 209.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 110.875, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 209.0, "tools/call_frequency": 2.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011915264651179314, "sampling/sampling_logp_difference/max": 0.32894766330718994, "sampling/importance_sampling_ratio/min": 0.5162224769592285, "sampling/importance_sampling_ratio/mean": 0.9611517190933228, "sampling/importance_sampling_ratio/max": 1.1616952419281006, "entropy": 0.3980562053620815, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.100301347672939, "epoch": 0.0059375, "step": 228 }, { "loss": 0.5788843035697937, "grad_norm": 11.747881889343262, "learning_rate": 2.482758620689655e-07, "num_tokens": 1514313.0, "completions/mean_length": 111.0, "completions/min_length": 71.0, "completions/max_length": 217.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 111.0, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 217.0, "tools/call_frequency": 2.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008764228783547878, "sampling/sampling_logp_difference/max": 0.22508716583251953, "sampling/importance_sampling_ratio/min": 0.7427531480789185, "sampling/importance_sampling_ratio/mean": 1.0354865789413452, "sampling/importance_sampling_ratio/max": 1.3873703479766846, "entropy": 0.30576622672379017, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.509747326374054, "epoch": 0.0059635416666666665, "step": 229 }, { "loss": 0.04729544371366501, "grad_norm": 5.205223560333252, "learning_rate": 2.448275862068965e-07, "num_tokens": 1520761.0, "completions/mean_length": 121.0, "completions/min_length": 69.0, "completions/max_length": 223.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 121.0, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 223.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.008530820719897747, "sampling/sampling_logp_difference/max": 0.2261028289794922, "sampling/importance_sampling_ratio/min": 0.5309289693832397, "sampling/importance_sampling_ratio/mean": 0.8819470405578613, "sampling/importance_sampling_ratio/max": 1.2538028955459595, "entropy": 0.3017638046294451, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.279969118535519, "epoch": 0.005989583333333334, "step": 230 }, { "loss": 0.08443466573953629, "grad_norm": 6.942614555358887, "learning_rate": 2.413793103448276e-07, "num_tokens": 1527342.0, "completions/mean_length": 136.5, "completions/min_length": 76.0, "completions/max_length": 289.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 136.5, "completions/min_terminated_length": 76.0, "completions/max_terminated_length": 289.0, "tools/call_frequency": 2.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013153485022485256, "sampling/sampling_logp_difference/max": 0.27301597595214844, "sampling/importance_sampling_ratio/min": 0.5421993136405945, "sampling/importance_sampling_ratio/mean": 0.9781385660171509, "sampling/importance_sampling_ratio/max": 1.3869011402130127, "entropy": 0.4315082561224699, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.417220417410135, "epoch": 0.006015625, "step": 231 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 2.3793103448275863e-07, "num_tokens": 1533616.0, "completions/mean_length": 98.25, "completions/min_length": 71.0, "completions/max_length": 192.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 98.25, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 192.0, "tools/call_frequency": 1.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.011975917033851147, "sampling/sampling_logp_difference/max": 0.19208061695098877, "sampling/importance_sampling_ratio/min": 0.6422286033630371, "sampling/importance_sampling_ratio/mean": 1.0429977178573608, "sampling/importance_sampling_ratio/max": 1.6442532539367676, "entropy": 0.4107196293771267, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 3.9623564667999744, "epoch": 0.0060416666666666665, "step": 232 }, { "loss": 0.1327264904975891, "grad_norm": 6.5794806480407715, "learning_rate": 2.3448275862068964e-07, "num_tokens": 1540015.0, "completions/mean_length": 113.625, "completions/min_length": 70.0, "completions/max_length": 225.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 113.625, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 225.0, "tools/call_frequency": 2.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01154260616749525, "sampling/sampling_logp_difference/max": 0.32723474502563477, "sampling/importance_sampling_ratio/min": 0.6554647088050842, "sampling/importance_sampling_ratio/mean": 0.9892325401306152, "sampling/importance_sampling_ratio/max": 1.4028586149215698, "entropy": 0.3924696184694767, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.227699548006058, "epoch": 0.006067708333333333, "step": 233 }, { "loss": 0.402605265378952, "grad_norm": 7.423785209655762, "learning_rate": 2.3103448275862066e-07, "num_tokens": 1546816.0, "completions/mean_length": 164.5, "completions/min_length": 72.0, "completions/max_length": 365.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 164.5, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 365.0, "tools/call_frequency": 3.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013277391903102398, "sampling/sampling_logp_difference/max": 0.21643924713134766, "sampling/importance_sampling_ratio/min": 0.5706875920295715, "sampling/importance_sampling_ratio/mean": 0.7940878868103027, "sampling/importance_sampling_ratio/max": 1.1356279850006104, "entropy": 0.46284560672938824, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.881978258490562, "epoch": 0.00609375, "step": 234 }, { "loss": 0.4352855384349823, "grad_norm": 8.960577964782715, "learning_rate": 2.2758620689655173e-07, "num_tokens": 1553274.0, "completions/mean_length": 121.875, "completions/min_length": 67.0, "completions/max_length": 250.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 121.875, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 250.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009843465872108936, "sampling/sampling_logp_difference/max": 0.2133629322052002, "sampling/importance_sampling_ratio/min": 0.5495107769966125, "sampling/importance_sampling_ratio/mean": 0.9446932077407837, "sampling/importance_sampling_ratio/max": 1.1463549137115479, "entropy": 0.3563223108649254, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.381809528917074, "epoch": 0.006119791666666667, "step": 235 }, { "loss": 0.2254079431295395, "grad_norm": 7.389021396636963, "learning_rate": 2.2413793103448274e-07, "num_tokens": 1560059.0, "completions/mean_length": 162.625, "completions/min_length": 74.0, "completions/max_length": 296.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 162.625, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 296.0, "tools/call_frequency": 3.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012515394017100334, "sampling/sampling_logp_difference/max": 0.27469396591186523, "sampling/importance_sampling_ratio/min": 0.5793212056159973, "sampling/importance_sampling_ratio/mean": 0.9545640349388123, "sampling/importance_sampling_ratio/max": 1.430768609046936, "entropy": 0.4306243769824505, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.27208286896348, "epoch": 0.006145833333333333, "step": 236 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 2.206896551724138e-07, "num_tokens": 1566444.0, "completions/mean_length": 112.5, "completions/min_length": 74.0, "completions/max_length": 220.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 112.5, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 220.0, "tools/call_frequency": 1.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.012234870344400406, "sampling/sampling_logp_difference/max": 0.2455425262451172, "sampling/importance_sampling_ratio/min": 0.4859005808830261, "sampling/importance_sampling_ratio/mean": 0.9904327988624573, "sampling/importance_sampling_ratio/max": 1.4598642587661743, "entropy": 0.41240089014172554, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.247735887765884, "epoch": 0.006171875, "step": 237 }, { "loss": 0.14990873634815216, "grad_norm": 5.708603858947754, "learning_rate": 2.172413793103448e-07, "num_tokens": 1573107.0, "completions/mean_length": 146.75, "completions/min_length": 66.0, "completions/max_length": 372.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 146.75, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 372.0, "tools/call_frequency": 2.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010239748284220695, "sampling/sampling_logp_difference/max": 0.22030401229858398, "sampling/importance_sampling_ratio/min": 0.4491298496723175, "sampling/importance_sampling_ratio/mean": 0.9548370242118835, "sampling/importance_sampling_ratio/max": 1.6403262615203857, "entropy": 0.38685277476906776, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.7222266383469105, "epoch": 0.006197916666666667, "step": 238 }, { "loss": 0.30410444736480713, "grad_norm": 6.919494152069092, "learning_rate": 2.1379310344827587e-07, "num_tokens": 1579653.0, "completions/mean_length": 132.875, "completions/min_length": 68.0, "completions/max_length": 312.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 132.875, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 312.0, "tools/call_frequency": 2.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012275275774300098, "sampling/sampling_logp_difference/max": 0.4161001443862915, "sampling/importance_sampling_ratio/min": 0.5186476707458496, "sampling/importance_sampling_ratio/mean": 0.7974859476089478, "sampling/importance_sampling_ratio/max": 1.1094839572906494, "entropy": 0.3361106123775244, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.908729072660208, "epoch": 0.006223958333333333, "step": 239 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 2.103448275862069e-07, "num_tokens": 1585795.0, "completions/mean_length": 82.25, "completions/min_length": 68.0, "completions/max_length": 107.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 82.25, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 107.0, "tools/call_frequency": 1.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.01233686413615942, "sampling/sampling_logp_difference/max": 0.4248065948486328, "sampling/importance_sampling_ratio/min": 0.5713846683502197, "sampling/importance_sampling_ratio/mean": 1.1775957345962524, "sampling/importance_sampling_ratio/max": 2.224435567855835, "entropy": 0.342247923836112, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 3.64138338342309, "epoch": 0.00625, "step": 240 }, { "loss": 0.2744162380695343, "grad_norm": 9.401144981384277, "learning_rate": 2.0689655172413793e-07, "num_tokens": 1592447.0, "completions/mean_length": 146.0, "completions/min_length": 74.0, "completions/max_length": 257.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 146.0, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 257.0, "tools/call_frequency": 2.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01303884293884039, "sampling/sampling_logp_difference/max": 0.38067054748535156, "sampling/importance_sampling_ratio/min": 0.5110273361206055, "sampling/importance_sampling_ratio/mean": 0.8686518669128418, "sampling/importance_sampling_ratio/max": 1.1720399856567383, "entropy": 0.421370230615139, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.388774648308754, "epoch": 0.006276041666666667, "step": 241 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 2.0344827586206895e-07, "num_tokens": 1598788.0, "completions/mean_length": 106.25, "completions/min_length": 68.0, "completions/max_length": 184.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 106.25, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 184.0, "tools/call_frequency": 1.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.012026702985167503, "sampling/sampling_logp_difference/max": 0.25853919982910156, "sampling/importance_sampling_ratio/min": 0.77313631772995, "sampling/importance_sampling_ratio/mean": 1.1583786010742188, "sampling/importance_sampling_ratio/max": 1.631077766418457, "entropy": 0.34156747721135616, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 3.996856901794672, "epoch": 0.006302083333333333, "step": 242 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 2e-07, "num_tokens": 1605088.0, "completions/mean_length": 101.75, "completions/min_length": 69.0, "completions/max_length": 143.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 101.75, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 143.0, "tools/call_frequency": 1.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.01177971251308918, "sampling/sampling_logp_difference/max": 0.3938133716583252, "sampling/importance_sampling_ratio/min": 0.5634831786155701, "sampling/importance_sampling_ratio/mean": 0.9299900531768799, "sampling/importance_sampling_ratio/max": 1.3045389652252197, "entropy": 0.3557300139218569, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 3.792428206652403, "epoch": 0.006328125, "step": 243 }, { "loss": 0.8968291282653809, "grad_norm": 20.50238800048828, "learning_rate": 1.9655172413793103e-07, "num_tokens": 1611475.0, "completions/mean_length": 112.5, "completions/min_length": 77.0, "completions/max_length": 261.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 112.5, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 261.0, "tools/call_frequency": 1.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012752820737659931, "sampling/sampling_logp_difference/max": 0.3744630813598633, "sampling/importance_sampling_ratio/min": 0.5593265295028687, "sampling/importance_sampling_ratio/mean": 1.1518104076385498, "sampling/importance_sampling_ratio/max": 1.924498438835144, "entropy": 0.3892900198698044, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.258405860513449, "epoch": 0.006354166666666667, "step": 244 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 1.9310344827586205e-07, "num_tokens": 1617932.0, "completions/mean_length": 121.75, "completions/min_length": 70.0, "completions/max_length": 301.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 121.75, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 301.0, "tools/call_frequency": 2.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.013255810365080833, "sampling/sampling_logp_difference/max": 0.3091144561767578, "sampling/importance_sampling_ratio/min": 0.2775188088417053, "sampling/importance_sampling_ratio/mean": 0.8584268093109131, "sampling/importance_sampling_ratio/max": 1.1039010286331177, "entropy": 0.3750423062592745, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.395967200398445, "epoch": 0.006380208333333333, "step": 245 }, { "loss": 0.1423274278640747, "grad_norm": 4.962782382965088, "learning_rate": 1.896551724137931e-07, "num_tokens": 1624784.0, "completions/mean_length": 169.625, "completions/min_length": 67.0, "completions/max_length": 252.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 169.625, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 252.0, "tools/call_frequency": 3.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013426621444523335, "sampling/sampling_logp_difference/max": 0.2526674270629883, "sampling/importance_sampling_ratio/min": 0.36478468775749207, "sampling/importance_sampling_ratio/mean": 0.8246872425079346, "sampling/importance_sampling_ratio/max": 1.2307977676391602, "entropy": 0.4405743684619665, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.843937441706657, "epoch": 0.00640625, "step": 246 }, { "loss": 0.2473740428686142, "grad_norm": 7.346534729003906, "learning_rate": 1.8620689655172414e-07, "num_tokens": 1631330.0, "completions/mean_length": 133.125, "completions/min_length": 71.0, "completions/max_length": 291.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 133.125, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 291.0, "tools/call_frequency": 2.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011962310411036015, "sampling/sampling_logp_difference/max": 0.30948901176452637, "sampling/importance_sampling_ratio/min": 0.51829594373703, "sampling/importance_sampling_ratio/mean": 0.9812578558921814, "sampling/importance_sampling_ratio/max": 1.4125739336013794, "entropy": 0.3682870827615261, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.540961917489767, "epoch": 0.006432291666666667, "step": 247 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 1.8275862068965518e-07, "num_tokens": 1637739.0, "completions/mean_length": 115.125, "completions/min_length": 67.0, "completions/max_length": 261.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 115.125, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 261.0, "tools/call_frequency": 2.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.011308192275464535, "sampling/sampling_logp_difference/max": 0.2711300849914551, "sampling/importance_sampling_ratio/min": 0.8209143280982971, "sampling/importance_sampling_ratio/mean": 1.1564793586730957, "sampling/importance_sampling_ratio/max": 1.8234361410140991, "entropy": 0.3624811824411154, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.31484991312027, "epoch": 0.006458333333333333, "step": 248 }, { "loss": 0.07034649699926376, "grad_norm": 5.420164108276367, "learning_rate": 1.793103448275862e-07, "num_tokens": 1644229.0, "completions/mean_length": 125.5, "completions/min_length": 72.0, "completions/max_length": 270.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 125.5, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 270.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012347054667770863, "sampling/sampling_logp_difference/max": 0.3436160087585449, "sampling/importance_sampling_ratio/min": 0.44767650961875916, "sampling/importance_sampling_ratio/mean": 0.8431032299995422, "sampling/importance_sampling_ratio/max": 1.4753562211990356, "entropy": 0.38236445374786854, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.447813358157873, "epoch": 0.006484375, "step": 249 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 1.758620689655172e-07, "num_tokens": 1650582.0, "completions/mean_length": 107.75, "completions/min_length": 68.0, "completions/max_length": 239.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 107.75, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 239.0, "tools/call_frequency": 1.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.011250519193708897, "sampling/sampling_logp_difference/max": 0.20965266227722168, "sampling/importance_sampling_ratio/min": 0.5831136107444763, "sampling/importance_sampling_ratio/mean": 0.9154021739959717, "sampling/importance_sampling_ratio/max": 1.5456960201263428, "entropy": 0.3843225818127394, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.235317442566156, "epoch": 0.006510416666666667, "step": 250 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 1.7241379310344828e-07, "num_tokens": 1656707.0, "completions/mean_length": 79.875, "completions/min_length": 74.0, "completions/max_length": 90.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 79.875, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 90.0, "tools/call_frequency": 1.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.01105342898517847, "sampling/sampling_logp_difference/max": 0.36299288272857666, "sampling/importance_sampling_ratio/min": 0.45478442311286926, "sampling/importance_sampling_ratio/mean": 0.8846508264541626, "sampling/importance_sampling_ratio/max": 1.4821677207946777, "entropy": 0.33434370532631874, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 3.5552473478019238, "epoch": 0.006536458333333333, "step": 251 }, { "loss": 0.7705017328262329, "grad_norm": 11.779228210449219, "learning_rate": 1.689655172413793e-07, "num_tokens": 1663112.0, "completions/mean_length": 115.0, "completions/min_length": 70.0, "completions/max_length": 234.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 115.0, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 234.0, "tools/call_frequency": 2.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010739600285887718, "sampling/sampling_logp_difference/max": 0.2691793441772461, "sampling/importance_sampling_ratio/min": 0.6300632953643799, "sampling/importance_sampling_ratio/mean": 0.9815887212753296, "sampling/importance_sampling_ratio/max": 1.6451809406280518, "entropy": 0.33214167691767216, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.225358031690121, "epoch": 0.0065625, "step": 252 }, { "loss": 0.3063722550868988, "grad_norm": 9.069360733032227, "learning_rate": 1.6551724137931034e-07, "num_tokens": 1669629.0, "completions/mean_length": 128.625, "completions/min_length": 66.0, "completions/max_length": 267.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 128.625, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 267.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011863093823194504, "sampling/sampling_logp_difference/max": 0.218658447265625, "sampling/importance_sampling_ratio/min": 0.4986332952976227, "sampling/importance_sampling_ratio/mean": 0.837560772895813, "sampling/importance_sampling_ratio/max": 1.3050978183746338, "entropy": 0.41538802348077297, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.744722697883844, "epoch": 0.006588541666666667, "step": 253 }, { "loss": 0.6463911533355713, "grad_norm": 11.25007152557373, "learning_rate": 1.6206896551724136e-07, "num_tokens": 1676247.0, "completions/mean_length": 141.75, "completions/min_length": 76.0, "completions/max_length": 269.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 141.75, "completions/min_terminated_length": 76.0, "completions/max_terminated_length": 269.0, "tools/call_frequency": 2.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01386319287121296, "sampling/sampling_logp_difference/max": 0.49417829513549805, "sampling/importance_sampling_ratio/min": 0.929777979850769, "sampling/importance_sampling_ratio/mean": 1.1681396961212158, "sampling/importance_sampling_ratio/max": 1.6235978603363037, "entropy": 0.4391930364072323, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.795429974794388, "epoch": 0.006614583333333333, "step": 254 }, { "loss": -0.25452253222465515, "grad_norm": 2.4696967601776123, "learning_rate": 1.5862068965517243e-07, "num_tokens": 1682814.0, "completions/mean_length": 136.0, "completions/min_length": 75.0, "completions/max_length": 289.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 136.0, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 289.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012699998915195465, "sampling/sampling_logp_difference/max": 0.3478074073791504, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.8453823328018188, "sampling/importance_sampling_ratio/max": 1.3936424255371094, "entropy": 0.401802821084857, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.087458718568087, "epoch": 0.006640625, "step": 255 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 1.5517241379310344e-07, "num_tokens": 1689417.0, "completions/mean_length": 139.0, "completions/min_length": 73.0, "completions/max_length": 229.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 139.0, "completions/min_terminated_length": 73.0, "completions/max_terminated_length": 229.0, "tools/call_frequency": 2.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.01362011581659317, "sampling/sampling_logp_difference/max": 0.2250657081604004, "sampling/importance_sampling_ratio/min": 0.37478578090667725, "sampling/importance_sampling_ratio/mean": 0.8172546625137329, "sampling/importance_sampling_ratio/max": 1.4671869277954102, "entropy": 0.4447487201541662, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.783331546932459, "epoch": 0.006666666666666667, "step": 256 }, { "loss": 0.042479008436203, "grad_norm": 6.792513370513916, "learning_rate": 1.5172413793103449e-07, "num_tokens": 1696005.0, "completions/mean_length": 137.875, "completions/min_length": 77.0, "completions/max_length": 282.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 137.875, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 282.0, "tools/call_frequency": 2.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01219947449862957, "sampling/sampling_logp_difference/max": 0.3132779598236084, "sampling/importance_sampling_ratio/min": 0.5582106709480286, "sampling/importance_sampling_ratio/mean": 1.054414987564087, "sampling/importance_sampling_ratio/max": 1.6568481922149658, "entropy": 0.40117553621530533, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.732860706746578, "epoch": 0.0066927083333333335, "step": 257 }, { "loss": -0.028782352805137634, "grad_norm": 6.8916850090026855, "learning_rate": 1.482758620689655e-07, "num_tokens": 1702736.0, "completions/mean_length": 155.375, "completions/min_length": 37.0, "completions/max_length": 297.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 155.375, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 297.0, "tools/call_frequency": 3.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.036250002682209015, "rewards/reward_func/std": 0.019955307245254517, "reward": 0.036250002682209015, "reward_std": 0.019955307245254517, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01261419802904129, "sampling/sampling_logp_difference/max": 0.23758888244628906, "sampling/importance_sampling_ratio/min": 0.8021863102912903, "sampling/importance_sampling_ratio/mean": 1.0601112842559814, "sampling/importance_sampling_ratio/max": 1.5224790573120117, "entropy": 0.4475422278046608, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.898925796151161, "epoch": 0.00671875, "step": 258 }, { "loss": 0.4860846996307373, "grad_norm": 8.632187843322754, "learning_rate": 1.4482758620689654e-07, "num_tokens": 1709413.0, "completions/mean_length": 149.0, "completions/min_length": 78.0, "completions/max_length": 229.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 149.0, "completions/min_terminated_length": 78.0, "completions/max_terminated_length": 229.0, "tools/call_frequency": 3.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01191042736172676, "sampling/sampling_logp_difference/max": 0.31433749198913574, "sampling/importance_sampling_ratio/min": 0.7918771505355835, "sampling/importance_sampling_ratio/mean": 1.0567115545272827, "sampling/importance_sampling_ratio/max": 1.550087571144104, "entropy": 0.4268493577837944, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.776560887694359, "epoch": 0.006744791666666666, "step": 259 }, { "loss": 0.7819214463233948, "grad_norm": 14.320728302001953, "learning_rate": 1.413793103448276e-07, "num_tokens": 1716061.0, "completions/mean_length": 145.625, "completions/min_length": 69.0, "completions/max_length": 269.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 145.625, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 269.0, "tools/call_frequency": 2.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013627855107188225, "sampling/sampling_logp_difference/max": 0.2401266098022461, "sampling/importance_sampling_ratio/min": 0.7329464554786682, "sampling/importance_sampling_ratio/mean": 1.0565303564071655, "sampling/importance_sampling_ratio/max": 1.8856542110443115, "entropy": 0.45499586686491966, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.572375640273094, "epoch": 0.0067708333333333336, "step": 260 }, { "loss": 0.07219955325126648, "grad_norm": 4.486326217651367, "learning_rate": 1.379310344827586e-07, "num_tokens": 1722617.0, "completions/mean_length": 132.75, "completions/min_length": 70.0, "completions/max_length": 231.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 132.75, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 231.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013247912749648094, "sampling/sampling_logp_difference/max": 0.41723620891571045, "sampling/importance_sampling_ratio/min": 0.31496456265449524, "sampling/importance_sampling_ratio/mean": 0.6999540328979492, "sampling/importance_sampling_ratio/max": 0.993986964225769, "entropy": 0.48321819491684437, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.35433280095458, "epoch": 0.006796875, "step": 261 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 1.3448275862068965e-07, "num_tokens": 1729090.0, "completions/mean_length": 123.75, "completions/min_length": 75.0, "completions/max_length": 251.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 123.75, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 251.0, "tools/call_frequency": 2.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.010842503048479557, "sampling/sampling_logp_difference/max": 0.2613506317138672, "sampling/importance_sampling_ratio/min": 0.7672865986824036, "sampling/importance_sampling_ratio/mean": 1.244701862335205, "sampling/importance_sampling_ratio/max": 2.468782901763916, "entropy": 0.3914359211921692, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.254163131117821, "epoch": 0.006822916666666666, "step": 262 }, { "loss": 0.15148787200450897, "grad_norm": 6.149950981140137, "learning_rate": 1.310344827586207e-07, "num_tokens": 1735777.0, "completions/mean_length": 150.25, "completions/min_length": 69.0, "completions/max_length": 288.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 150.25, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 288.0, "tools/call_frequency": 3.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011738087050616741, "sampling/sampling_logp_difference/max": 0.30169081687927246, "sampling/importance_sampling_ratio/min": 0.5324463844299316, "sampling/importance_sampling_ratio/mean": 0.781113862991333, "sampling/importance_sampling_ratio/max": 1.0696625709533691, "entropy": 0.38973900489509106, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.607690282166004, "epoch": 0.006848958333333334, "step": 263 }, { "loss": 0.37017062306404114, "grad_norm": 11.221770286560059, "learning_rate": 1.2758620689655173e-07, "num_tokens": 1742281.0, "completions/mean_length": 127.625, "completions/min_length": 79.0, "completions/max_length": 287.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 127.625, "completions/min_terminated_length": 79.0, "completions/max_terminated_length": 287.0, "tools/call_frequency": 2.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013899856247007847, "sampling/sampling_logp_difference/max": 0.24550151824951172, "sampling/importance_sampling_ratio/min": 0.5695619583129883, "sampling/importance_sampling_ratio/mean": 0.8453925848007202, "sampling/importance_sampling_ratio/max": 1.2200438976287842, "entropy": 0.47930552065372467, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.319764152169228, "epoch": 0.006875, "step": 264 }, { "loss": 0.08389385044574738, "grad_norm": 8.317436218261719, "learning_rate": 1.2413793103448275e-07, "num_tokens": 1748960.0, "completions/mean_length": 149.375, "completions/min_length": 72.0, "completions/max_length": 260.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 149.375, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 260.0, "tools/call_frequency": 3.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010441875085234642, "sampling/sampling_logp_difference/max": 0.2313232421875, "sampling/importance_sampling_ratio/min": 0.8075160384178162, "sampling/importance_sampling_ratio/mean": 1.1571221351623535, "sampling/importance_sampling_ratio/max": 1.985337495803833, "entropy": 0.42238908633589745, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.607502739876509, "epoch": 0.0069010416666666664, "step": 265 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 1.206896551724138e-07, "num_tokens": 1755561.0, "completions/mean_length": 138.875, "completions/min_length": 71.0, "completions/max_length": 322.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 138.875, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 322.0, "tools/call_frequency": 2.25, "tools/failure_frequency": 0.2777777910232544, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.011237440630793571, "sampling/sampling_logp_difference/max": 0.24850058555603027, "sampling/importance_sampling_ratio/min": 0.8335959911346436, "sampling/importance_sampling_ratio/mean": 1.073771357536316, "sampling/importance_sampling_ratio/max": 1.2142795324325562, "entropy": 0.35598164796829224, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.57135247439146, "epoch": 0.006927083333333334, "step": 266 }, { "loss": 0.9753967523574829, "grad_norm": 18.79526138305664, "learning_rate": 1.1724137931034482e-07, "num_tokens": 1761972.0, "completions/mean_length": 115.75, "completions/min_length": 70.0, "completions/max_length": 274.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 115.75, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 274.0, "tools/call_frequency": 2.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011597433127462864, "sampling/sampling_logp_difference/max": 0.26330816745758057, "sampling/importance_sampling_ratio/min": 0.6595337390899658, "sampling/importance_sampling_ratio/mean": 1.1310017108917236, "sampling/importance_sampling_ratio/max": 2.041294813156128, "entropy": 0.37283606082201004, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.628953363746405, "epoch": 0.006953125, "step": 267 }, { "loss": 0.1407385766506195, "grad_norm": 6.709783554077148, "learning_rate": 1.1379310344827586e-07, "num_tokens": 1768688.0, "completions/mean_length": 153.125, "completions/min_length": 76.0, "completions/max_length": 269.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 153.125, "completions/min_terminated_length": 76.0, "completions/max_terminated_length": 269.0, "tools/call_frequency": 3.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011658101342618465, "sampling/sampling_logp_difference/max": 0.20760440826416016, "sampling/importance_sampling_ratio/min": 0.29518187046051025, "sampling/importance_sampling_ratio/mean": 0.8446435332298279, "sampling/importance_sampling_ratio/max": 1.132695198059082, "entropy": 0.381710696965456, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.56982546672225, "epoch": 0.0069791666666666665, "step": 268 }, { "loss": 0.2527141571044922, "grad_norm": 10.2232084274292, "learning_rate": 1.103448275862069e-07, "num_tokens": 1775345.0, "completions/mean_length": 145.625, "completions/min_length": 76.0, "completions/max_length": 265.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 145.625, "completions/min_terminated_length": 76.0, "completions/max_terminated_length": 265.0, "tools/call_frequency": 2.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013182499445974827, "sampling/sampling_logp_difference/max": 0.253065288066864, "sampling/importance_sampling_ratio/min": 0.4400932788848877, "sampling/importance_sampling_ratio/mean": 1.2850861549377441, "sampling/importance_sampling_ratio/max": 1.828995943069458, "entropy": 0.4312727153301239, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.711833827197552, "epoch": 0.007005208333333333, "step": 269 }, { "loss": 0.3850674331188202, "grad_norm": 11.476179122924805, "learning_rate": 1.0689655172413794e-07, "num_tokens": 1781847.0, "completions/mean_length": 126.75, "completions/min_length": 76.0, "completions/max_length": 243.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 126.75, "completions/min_terminated_length": 76.0, "completions/max_terminated_length": 243.0, "tools/call_frequency": 2.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013755693100392818, "sampling/sampling_logp_difference/max": 0.287384033203125, "sampling/importance_sampling_ratio/min": 0.7775720357894897, "sampling/importance_sampling_ratio/mean": 1.0901168584823608, "sampling/importance_sampling_ratio/max": 1.621045708656311, "entropy": 0.4050389751791954, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.5725556537508965, "epoch": 0.00703125, "step": 270 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 1.0344827586206897e-07, "num_tokens": 1788137.0, "completions/mean_length": 100.25, "completions/min_length": 76.0, "completions/max_length": 128.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 100.25, "completions/min_terminated_length": 76.0, "completions/max_terminated_length": 128.0, "tools/call_frequency": 1.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.011761503294110298, "sampling/sampling_logp_difference/max": 0.24228429794311523, "sampling/importance_sampling_ratio/min": 0.4475219249725342, "sampling/importance_sampling_ratio/mean": 0.9587810039520264, "sampling/importance_sampling_ratio/max": 1.3084263801574707, "entropy": 0.36945314705371857, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.326859299093485, "epoch": 0.007057291666666667, "step": 271 }, { "loss": 0.13966688513755798, "grad_norm": 7.985146999359131, "learning_rate": 1e-07, "num_tokens": 1794842.0, "completions/mean_length": 152.0, "completions/min_length": 69.0, "completions/max_length": 257.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 152.0, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 257.0, "tools/call_frequency": 3.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.012257814407348633, "sampling/sampling_logp_difference/max": 0.23528480529785156, "sampling/importance_sampling_ratio/min": 0.5759143233299255, "sampling/importance_sampling_ratio/mean": 0.8540890216827393, "sampling/importance_sampling_ratio/max": 1.3689486980438232, "entropy": 0.4255378097295761, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.523588839918375, "epoch": 0.007083333333333333, "step": 272 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 9.655172413793103e-08, "num_tokens": 1801073.0, "completions/mean_length": 93.125, "completions/min_length": 74.0, "completions/max_length": 183.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 93.125, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 183.0, "tools/call_frequency": 1.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.009758113883435726, "sampling/sampling_logp_difference/max": 0.20165228843688965, "sampling/importance_sampling_ratio/min": 0.711251974105835, "sampling/importance_sampling_ratio/mean": 0.9871619939804077, "sampling/importance_sampling_ratio/max": 1.5335099697113037, "entropy": 0.36211518943309784, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 3.8618279322981834, "epoch": 0.007109375, "step": 273 }, { "loss": 0.7438125014305115, "grad_norm": 20.87550163269043, "learning_rate": 9.310344827586207e-08, "num_tokens": 1807528.0, "completions/mean_length": 121.25, "completions/min_length": 78.0, "completions/max_length": 227.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 121.25, "completions/min_terminated_length": 78.0, "completions/max_terminated_length": 227.0, "tools/call_frequency": 2.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011054747737944126, "sampling/sampling_logp_difference/max": 0.306357741355896, "sampling/importance_sampling_ratio/min": 0.584359347820282, "sampling/importance_sampling_ratio/mean": 1.1412510871887207, "sampling/importance_sampling_ratio/max": 1.7848306894302368, "entropy": 0.3993511199951172, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.4329588785767555, "epoch": 0.007135416666666667, "step": 274 }, { "loss": 0.16193309426307678, "grad_norm": 4.9770073890686035, "learning_rate": 8.96551724137931e-08, "num_tokens": 1814468.0, "completions/mean_length": 180.125, "completions/min_length": 73.0, "completions/max_length": 385.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 180.125, "completions/min_terminated_length": 73.0, "completions/max_terminated_length": 385.0, "tools/call_frequency": 3.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01576872169971466, "sampling/sampling_logp_difference/max": 0.3658018112182617, "sampling/importance_sampling_ratio/min": 0.4295932948589325, "sampling/importance_sampling_ratio/mean": 0.8592667579650879, "sampling/importance_sampling_ratio/max": 1.5670956373214722, "entropy": 0.47048109397292137, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.859539113938808, "epoch": 0.007161458333333333, "step": 275 }, { "loss": 0.40237608551979065, "grad_norm": 6.163737773895264, "learning_rate": 8.620689655172414e-08, "num_tokens": 1821714.0, "completions/mean_length": 219.125, "completions/min_length": 85.0, "completions/max_length": 685.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 219.125, "completions/min_terminated_length": 85.0, "completions/max_terminated_length": 685.0, "tools/call_frequency": 4.125, "tools/failure_frequency": 0.3333333432674408, "rewards/reward_func/mean": 0.03999999910593033, "rewards/reward_func/std": 0.01927248388528824, "reward": 0.03999999910593033, "reward_std": 0.01927248202264309, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.014155134558677673, "sampling/sampling_logp_difference/max": 0.2597932815551758, "sampling/importance_sampling_ratio/min": 0.4432338774204254, "sampling/importance_sampling_ratio/mean": 0.8505239486694336, "sampling/importance_sampling_ratio/max": 1.874996542930603, "entropy": 0.4612193629145622, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 6.906406059861183, "epoch": 0.0071875, "step": 276 }, { "loss": 0.44495847821235657, "grad_norm": 11.078022003173828, "learning_rate": 8.275862068965517e-08, "num_tokens": 1828072.0, "completions/mean_length": 109.125, "completions/min_length": 72.0, "completions/max_length": 257.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 109.125, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 257.0, "tools/call_frequency": 1.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01147474069148302, "sampling/sampling_logp_difference/max": 0.31108736991882324, "sampling/importance_sampling_ratio/min": 0.571040153503418, "sampling/importance_sampling_ratio/mean": 0.8329801559448242, "sampling/importance_sampling_ratio/max": 1.3575739860534668, "entropy": 0.3342920280992985, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.449655279517174, "epoch": 0.007213541666666667, "step": 277 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 7.931034482758621e-08, "num_tokens": 1834352.0, "completions/mean_length": 98.375, "completions/min_length": 65.0, "completions/max_length": 205.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 98.375, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 205.0, "tools/call_frequency": 1.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.011004039086401463, "sampling/sampling_logp_difference/max": 0.2481316328048706, "sampling/importance_sampling_ratio/min": 0.6326379776000977, "sampling/importance_sampling_ratio/mean": 0.9662011861801147, "sampling/importance_sampling_ratio/max": 1.8022511005401611, "entropy": 0.32181683368980885, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.241747297346592, "epoch": 0.007239583333333333, "step": 278 }, { "loss": 0.44562286138534546, "grad_norm": 8.47037410736084, "learning_rate": 7.586206896551724e-08, "num_tokens": 1841173.0, "completions/mean_length": 167.375, "completions/min_length": 67.0, "completions/max_length": 275.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 167.375, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 275.0, "tools/call_frequency": 3.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013328377157449722, "sampling/sampling_logp_difference/max": 0.3578495979309082, "sampling/importance_sampling_ratio/min": 0.4581547677516937, "sampling/importance_sampling_ratio/mean": 1.0401952266693115, "sampling/importance_sampling_ratio/max": 1.4747649431228638, "entropy": 0.4210407976061106, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.5847341269254684, "epoch": 0.007265625, "step": 279 }, { "loss": -0.03316352888941765, "grad_norm": 5.062624931335449, "learning_rate": 7.241379310344827e-08, "num_tokens": 1847746.0, "completions/mean_length": 136.125, "completions/min_length": 70.0, "completions/max_length": 310.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 136.125, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 310.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01335821021348238, "sampling/sampling_logp_difference/max": 0.5180027484893799, "sampling/importance_sampling_ratio/min": 0.3388051688671112, "sampling/importance_sampling_ratio/mean": 0.8734016418457031, "sampling/importance_sampling_ratio/max": 1.276824712753296, "entropy": 0.39317552000284195, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.564523346722126, "epoch": 0.007291666666666667, "step": 280 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 6.89655172413793e-08, "num_tokens": 1854049.0, "completions/mean_length": 102.0, "completions/min_length": 71.0, "completions/max_length": 161.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 102.0, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 161.0, "tools/call_frequency": 1.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.01105661503970623, "sampling/sampling_logp_difference/max": 0.2203744649887085, "sampling/importance_sampling_ratio/min": 0.48088380694389343, "sampling/importance_sampling_ratio/mean": 0.7941042184829712, "sampling/importance_sampling_ratio/max": 1.3110313415527344, "entropy": 0.3986786548048258, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 3.995740931481123, "epoch": 0.007317708333333333, "step": 281 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 6.551724137931034e-08, "num_tokens": 1860582.0, "completions/mean_length": 130.5, "completions/min_length": 72.0, "completions/max_length": 319.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 130.5, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 319.0, "tools/call_frequency": 2.5, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.012438568286597729, "sampling/sampling_logp_difference/max": 0.30464017391204834, "sampling/importance_sampling_ratio/min": 0.4535175561904907, "sampling/importance_sampling_ratio/mean": 0.8174393177032471, "sampling/importance_sampling_ratio/max": 1.0657907724380493, "entropy": 0.38229982554912567, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.504117142409086, "epoch": 0.00734375, "step": 282 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 6.206896551724137e-08, "num_tokens": 1866815.0, "completions/mean_length": 93.5, "completions/min_length": 72.0, "completions/max_length": 140.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 93.5, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 140.0, "tools/call_frequency": 1.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.012930222786962986, "sampling/sampling_logp_difference/max": 0.33137255907058716, "sampling/importance_sampling_ratio/min": 0.3496539890766144, "sampling/importance_sampling_ratio/mean": 0.8376764059066772, "sampling/importance_sampling_ratio/max": 1.1079111099243164, "entropy": 0.3724994268268347, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 3.712655235081911, "epoch": 0.007369791666666667, "step": 283 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 5.862068965517241e-08, "num_tokens": 1873045.0, "completions/mean_length": 93.0, "completions/min_length": 78.0, "completions/max_length": 134.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 93.0, "completions/min_terminated_length": 78.0, "completions/max_terminated_length": 134.0, "tools/call_frequency": 1.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.01299613993614912, "sampling/sampling_logp_difference/max": 0.5044503211975098, "sampling/importance_sampling_ratio/min": 0.49159035086631775, "sampling/importance_sampling_ratio/mean": 0.9234293103218079, "sampling/importance_sampling_ratio/max": 1.193027138710022, "entropy": 0.3958061747252941, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.465573392808437, "epoch": 0.007395833333333333, "step": 284 }, { "loss": 0.39896079897880554, "grad_norm": 15.04804515838623, "learning_rate": 5.517241379310345e-08, "num_tokens": 1879772.0, "completions/mean_length": 154.375, "completions/min_length": 75.0, "completions/max_length": 246.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 154.375, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 246.0, "tools/call_frequency": 3.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013603778555989265, "sampling/sampling_logp_difference/max": 0.24956703186035156, "sampling/importance_sampling_ratio/min": 0.26253074407577515, "sampling/importance_sampling_ratio/mean": 0.8751516938209534, "sampling/importance_sampling_ratio/max": 1.296643614768982, "entropy": 0.45330972597002983, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.538145769387484, "epoch": 0.007421875, "step": 285 }, { "loss": 0.07010338455438614, "grad_norm": 5.517930030822754, "learning_rate": 5.172413793103448e-08, "num_tokens": 1886233.0, "completions/mean_length": 121.375, "completions/min_length": 76.0, "completions/max_length": 206.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 121.375, "completions/min_terminated_length": 76.0, "completions/max_terminated_length": 206.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011033854447305202, "sampling/sampling_logp_difference/max": 0.3105945587158203, "sampling/importance_sampling_ratio/min": 0.449138879776001, "sampling/importance_sampling_ratio/mean": 0.795243501663208, "sampling/importance_sampling_ratio/max": 1.2061694860458374, "entropy": 0.3942301273345947, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.420508563518524, "epoch": 0.007447916666666667, "step": 286 }, { "loss": 0.178336501121521, "grad_norm": 7.924858093261719, "learning_rate": 4.827586206896551e-08, "num_tokens": 1892752.0, "completions/mean_length": 129.25, "completions/min_length": 70.0, "completions/max_length": 302.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 129.25, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 302.0, "tools/call_frequency": 2.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.015458998270332813, "sampling/sampling_logp_difference/max": 0.4543032646179199, "sampling/importance_sampling_ratio/min": 0.4143412113189697, "sampling/importance_sampling_ratio/mean": 0.8323342800140381, "sampling/importance_sampling_ratio/max": 1.3250732421875, "entropy": 0.3896496035158634, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.770214453339577, "epoch": 0.007473958333333333, "step": 287 }, { "loss": 0.4996538758277893, "grad_norm": 10.280075073242188, "learning_rate": 4.482758620689655e-08, "num_tokens": 1899561.0, "completions/mean_length": 165.5, "completions/min_length": 82.0, "completions/max_length": 281.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 165.5, "completions/min_terminated_length": 82.0, "completions/max_terminated_length": 281.0, "tools/call_frequency": 3.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.038750000298023224, "rewards/reward_func/std": 0.015526475384831429, "reward": 0.038750000298023224, "reward_std": 0.015526475384831429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013006397522985935, "sampling/sampling_logp_difference/max": 0.3716449737548828, "sampling/importance_sampling_ratio/min": 0.7561920285224915, "sampling/importance_sampling_ratio/mean": 1.1260485649108887, "sampling/importance_sampling_ratio/max": 1.7321792840957642, "entropy": 0.4607531800866127, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.565570294857025, "epoch": 0.0075, "step": 288 }, { "loss": 0.09880037605762482, "grad_norm": 6.635493278503418, "learning_rate": 4.1379310344827585e-08, "num_tokens": 1906018.0, "completions/mean_length": 121.125, "completions/min_length": 71.0, "completions/max_length": 268.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 121.125, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 268.0, "tools/call_frequency": 2.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011291252449154854, "sampling/sampling_logp_difference/max": 0.3563816547393799, "sampling/importance_sampling_ratio/min": 0.46547731757164, "sampling/importance_sampling_ratio/mean": 0.8630009889602661, "sampling/importance_sampling_ratio/max": 1.3095393180847168, "entropy": 0.3620409518480301, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.364994611591101, "epoch": 0.007526041666666667, "step": 289 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 3.793103448275862e-08, "num_tokens": 1912313.0, "completions/mean_length": 100.875, "completions/min_length": 73.0, "completions/max_length": 182.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 100.875, "completions/min_terminated_length": 73.0, "completions/max_terminated_length": 182.0, "tools/call_frequency": 1.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.011085974052548409, "sampling/sampling_logp_difference/max": 0.2234964370727539, "sampling/importance_sampling_ratio/min": 0.49764496088027954, "sampling/importance_sampling_ratio/mean": 0.8203271627426147, "sampling/importance_sampling_ratio/max": 1.1087837219238281, "entropy": 0.3637619912624359, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 3.946752030402422, "epoch": 0.007552083333333333, "step": 290 }, { "loss": 0.07282885909080505, "grad_norm": 5.272033214569092, "learning_rate": 3.448275862068965e-08, "num_tokens": 1919160.0, "completions/mean_length": 170.5, "completions/min_length": 85.0, "completions/max_length": 305.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 170.5, "completions/min_terminated_length": 85.0, "completions/max_terminated_length": 305.0, "tools/call_frequency": 3.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.042500000447034836, "rewards/reward_func/std": 0.01388730201870203, "reward": 0.042500000447034836, "reward_std": 0.013887301087379456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.014097451232373714, "sampling/sampling_logp_difference/max": 0.3057129383087158, "sampling/importance_sampling_ratio/min": 0.4977567493915558, "sampling/importance_sampling_ratio/mean": 0.8507600426673889, "sampling/importance_sampling_ratio/max": 1.680345058441162, "entropy": 0.5066847130656242, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.572480630129576, "epoch": 0.007578125, "step": 291 }, { "loss": 0.47781217098236084, "grad_norm": 14.663684844970703, "learning_rate": 3.103448275862069e-08, "num_tokens": 1925681.0, "completions/mean_length": 129.25, "completions/min_length": 82.0, "completions/max_length": 233.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 129.25, "completions/min_terminated_length": 82.0, "completions/max_terminated_length": 233.0, "tools/call_frequency": 2.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.009860091842710972, "sampling/sampling_logp_difference/max": 0.22348833084106445, "sampling/importance_sampling_ratio/min": 0.8452720046043396, "sampling/importance_sampling_ratio/mean": 1.097581386566162, "sampling/importance_sampling_ratio/max": 1.4050267934799194, "entropy": 0.38677122443914413, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 5.255236741155386, "epoch": 0.007604166666666667, "step": 292 }, { "loss": 0.14661124348640442, "grad_norm": 7.916061878204346, "learning_rate": 2.7586206896551723e-08, "num_tokens": 1932155.0, "completions/mean_length": 123.25, "completions/min_length": 75.0, "completions/max_length": 206.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 123.25, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 206.0, "tools/call_frequency": 2.25, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.010735097341239452, "sampling/sampling_logp_difference/max": 0.22974944114685059, "sampling/importance_sampling_ratio/min": 0.5868409276008606, "sampling/importance_sampling_ratio/mean": 1.0919897556304932, "sampling/importance_sampling_ratio/max": 1.6603084802627563, "entropy": 0.3767926637083292, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.344409696757793, "epoch": 0.0076302083333333335, "step": 293 }, { "loss": 0.11360034346580505, "grad_norm": 5.1230340003967285, "learning_rate": 2.4137931034482756e-08, "num_tokens": 1939152.0, "completions/mean_length": 188.25, "completions/min_length": 70.0, "completions/max_length": 277.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 188.25, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 277.0, "tools/call_frequency": 4.125, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.03500000014901161, "rewards/reward_func/std": 0.01603567600250244, "reward": 0.03500000014901161, "reward_std": 0.01603567600250244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0141568249091506, "sampling/sampling_logp_difference/max": 0.2450413703918457, "sampling/importance_sampling_ratio/min": 0.35865432024002075, "sampling/importance_sampling_ratio/mean": 0.7781403064727783, "sampling/importance_sampling_ratio/max": 1.0147700309753418, "entropy": 0.4720127061009407, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.631839144974947, "epoch": 0.00765625, "step": 294 }, { "loss": -0.10412270575761795, "grad_norm": 5.538921356201172, "learning_rate": 2.0689655172413793e-08, "num_tokens": 1945744.0, "completions/mean_length": 137.625, "completions/min_length": 71.0, "completions/max_length": 332.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 137.625, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 332.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013937311246991158, "sampling/sampling_logp_difference/max": 0.26548027992248535, "sampling/importance_sampling_ratio/min": 0.3042404055595398, "sampling/importance_sampling_ratio/mean": 0.9391204118728638, "sampling/importance_sampling_ratio/max": 2.279909372329712, "entropy": 0.3883692752569914, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.540512997657061, "epoch": 0.007682291666666666, "step": 295 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 1.7241379310344825e-08, "num_tokens": 1952124.0, "completions/mean_length": 111.75, "completions/min_length": 76.0, "completions/max_length": 172.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 111.75, "completions/min_terminated_length": 76.0, "completions/max_terminated_length": 172.0, "tools/call_frequency": 1.75, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.01113919261842966, "sampling/sampling_logp_difference/max": 0.1757526397705078, "sampling/importance_sampling_ratio/min": 0.6168844699859619, "sampling/importance_sampling_ratio/mean": 1.0056668519973755, "sampling/importance_sampling_ratio/max": 1.4122122526168823, "entropy": 0.37877720408141613, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 3.899154383689165, "epoch": 0.0077083333333333335, "step": 296 }, { "loss": 0.5456583499908447, "grad_norm": 13.457406997680664, "learning_rate": 1.3793103448275862e-08, "num_tokens": 1958634.0, "completions/mean_length": 127.25, "completions/min_length": 66.0, "completions/max_length": 322.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 127.25, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 322.0, "tools/call_frequency": 2.0, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01348401140421629, "sampling/sampling_logp_difference/max": 0.346210241317749, "sampling/importance_sampling_ratio/min": 0.6471983790397644, "sampling/importance_sampling_ratio/mean": 1.0347685813903809, "sampling/importance_sampling_ratio/max": 1.5019745826721191, "entropy": 0.3753661923110485, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.567156337201595, "epoch": 0.007734375, "step": 297 }, { "loss": 0.22464537620544434, "grad_norm": 7.81717586517334, "learning_rate": 1.0344827586206896e-08, "num_tokens": 1965176.0, "completions/mean_length": 131.5, "completions/min_length": 75.0, "completions/max_length": 230.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 131.5, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 230.0, "tools/call_frequency": 2.625, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.01140442956238985, "sampling/sampling_logp_difference/max": 0.23350095748901367, "sampling/importance_sampling_ratio/min": 0.6002361178398132, "sampling/importance_sampling_ratio/mean": 1.01103675365448, "sampling/importance_sampling_ratio/max": 1.6342579126358032, "entropy": 0.3824719712138176, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.413738798350096, "epoch": 0.007760416666666666, "step": 298 }, { "loss": 0.29455313086509705, "grad_norm": 11.099472045898438, "learning_rate": 6.896551724137931e-09, "num_tokens": 1971725.0, "completions/mean_length": 133.25, "completions/min_length": 72.0, "completions/max_length": 280.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 133.25, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 280.0, "tools/call_frequency": 2.375, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.04625000059604645, "rewards/reward_func/std": 0.010606602765619755, "reward": 0.04625000059604645, "reward_std": 0.01060660183429718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.011876091361045837, "sampling/sampling_logp_difference/max": 0.2500345706939697, "sampling/importance_sampling_ratio/min": 0.6783010959625244, "sampling/importance_sampling_ratio/mean": 1.0316640138626099, "sampling/importance_sampling_ratio/max": 1.4536182880401611, "entropy": 0.39311898685991764, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.447130784392357, "epoch": 0.007786458333333334, "step": 299 }, { "loss": 0.0, "grad_norm": 0.0, "learning_rate": 3.4482758620689654e-09, "num_tokens": 1978122.0, "completions/mean_length": 114.375, "completions/min_length": 79.0, "completions/max_length": 198.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 114.375, "completions/min_terminated_length": 79.0, "completions/max_terminated_length": 198.0, "tools/call_frequency": 1.875, "tools/failure_frequency": 0.0, "rewards/reward_func/mean": 0.05000000074505806, "rewards/reward_func/std": 0.0, "reward": 0.05000000074505806, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.010921039618551731, "sampling/sampling_logp_difference/max": 0.31644201278686523, "sampling/importance_sampling_ratio/min": 0.5520099401473999, "sampling/importance_sampling_ratio/mean": 0.9209573864936829, "sampling/importance_sampling_ratio/max": 1.5878106355667114, "entropy": 0.390807431191206, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "step_time": 4.919507894665003, "epoch": 0.0078125, "step": 300 }, { "train_runtime": 2281.1679, "train_samples_per_second": 1.052, "train_steps_per_second": 0.132, "total_flos": 0.0, "train_loss": 0.20039798735951384, "epoch": 0.0078125, "step": 300 } ]