10211 lines
391 KiB
JSON
10211 lines
391 KiB
JSON
[
|
|
{
|
|
"loss": -0.5885732769966125,
|
|
"grad_norm": 13.008904457092285,
|
|
"learning_rate": 0.0,
|
|
"num_tokens": 6268.0,
|
|
"completions/mean_length": 100.625,
|
|
"completions/min_length": 6.0,
|
|
"completions/max_length": 292.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 100.625,
|
|
"completions/min_terminated_length": 6.0,
|
|
"completions/max_terminated_length": 292.0,
|
|
"tools/call_frequency": 2.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.0024999999441206455,
|
|
"rewards/reward_func/std": 0.007071067579090595,
|
|
"reward": 0.0024999999441206455,
|
|
"reward_std": 0.007071067579090595,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013445030897855759,
|
|
"sampling/sampling_logp_difference/max": 0.35497260093688965,
|
|
"sampling/importance_sampling_ratio/min": 0.7549628615379333,
|
|
"sampling/importance_sampling_ratio/mean": 0.9896590113639832,
|
|
"sampling/importance_sampling_ratio/max": 1.2683002948760986,
|
|
"entropy": 0.524700028821826,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 37.835427328944206,
|
|
"epoch": 2.604166666666667e-05,
|
|
"step": 1
|
|
},
|
|
{
|
|
"loss": -0.25129565596580505,
|
|
"grad_norm": 8.018105506896973,
|
|
"learning_rate": 1e-07,
|
|
"num_tokens": 12735.0,
|
|
"completions/mean_length": 123.375,
|
|
"completions/min_length": 55.0,
|
|
"completions/max_length": 263.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 123.375,
|
|
"completions/min_terminated_length": 55.0,
|
|
"completions/max_terminated_length": 263.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.0062500000931322575,
|
|
"rewards/reward_func/std": 0.01767767034471035,
|
|
"reward": 0.0062500000931322575,
|
|
"reward_std": 0.0176776684820652,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013865306042134762,
|
|
"sampling/sampling_logp_difference/max": 0.3017702102661133,
|
|
"sampling/importance_sampling_ratio/min": 0.5517458319664001,
|
|
"sampling/importance_sampling_ratio/mean": 0.8847103118896484,
|
|
"sampling/importance_sampling_ratio/max": 1.180827260017395,
|
|
"entropy": 0.4682434909045696,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 36.486059200018644,
|
|
"epoch": 5.208333333333334e-05,
|
|
"step": 2
|
|
},
|
|
{
|
|
"loss": 0.0631505623459816,
|
|
"grad_norm": 10.868307113647461,
|
|
"learning_rate": 2e-07,
|
|
"num_tokens": 19351.0,
|
|
"completions/mean_length": 142.0,
|
|
"completions/min_length": 50.0,
|
|
"completions/max_length": 256.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 142.0,
|
|
"completions/min_terminated_length": 50.0,
|
|
"completions/max_terminated_length": 256.0,
|
|
"tools/call_frequency": 3.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.004999999888241291,
|
|
"rewards/reward_func/std": 0.009258201345801353,
|
|
"reward": 0.004999999888241291,
|
|
"reward_std": 0.009258200414478779,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012012362480163574,
|
|
"sampling/sampling_logp_difference/max": 0.25799161195755005,
|
|
"sampling/importance_sampling_ratio/min": 0.5464798212051392,
|
|
"sampling/importance_sampling_ratio/mean": 0.9767583608627319,
|
|
"sampling/importance_sampling_ratio/max": 1.5489927530288696,
|
|
"entropy": 0.4367520771920681,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 36.46552266925573,
|
|
"epoch": 7.8125e-05,
|
|
"step": 3
|
|
},
|
|
{
|
|
"loss": -0.3605692386627197,
|
|
"grad_norm": 10.616016387939453,
|
|
"learning_rate": 3e-07,
|
|
"num_tokens": 25612.0,
|
|
"completions/mean_length": 99.75,
|
|
"completions/min_length": 5.0,
|
|
"completions/max_length": 217.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 99.75,
|
|
"completions/min_terminated_length": 5.0,
|
|
"completions/max_terminated_length": 217.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.008750000037252903,
|
|
"rewards/reward_func/std": 0.018077217042446136,
|
|
"reward": 0.008750000037252903,
|
|
"reward_std": 0.018077215179800987,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010256679728627205,
|
|
"sampling/sampling_logp_difference/max": 0.232449471950531,
|
|
"sampling/importance_sampling_ratio/min": 0.7233827710151672,
|
|
"sampling/importance_sampling_ratio/mean": 1.0080759525299072,
|
|
"sampling/importance_sampling_ratio/max": 1.7840412855148315,
|
|
"entropy": 0.39893557876348495,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 36.25890198349953,
|
|
"epoch": 0.00010416666666666667,
|
|
"step": 4
|
|
},
|
|
{
|
|
"loss": 0.0312654972076416,
|
|
"grad_norm": 7.9504008293151855,
|
|
"learning_rate": 4e-07,
|
|
"num_tokens": 31985.0,
|
|
"completions/mean_length": 113.25,
|
|
"completions/min_length": 38.0,
|
|
"completions/max_length": 224.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 113.25,
|
|
"completions/min_terminated_length": 38.0,
|
|
"completions/max_terminated_length": 224.0,
|
|
"tools/call_frequency": 2.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.012500000186264515,
|
|
"rewards/reward_func/std": 0.02314550243318081,
|
|
"reward": 0.012500000186264515,
|
|
"reward_std": 0.02314550243318081,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012847134843468666,
|
|
"sampling/sampling_logp_difference/max": 0.4542774558067322,
|
|
"sampling/importance_sampling_ratio/min": 0.7518625855445862,
|
|
"sampling/importance_sampling_ratio/mean": 1.03047513961792,
|
|
"sampling/importance_sampling_ratio/max": 1.4058701992034912,
|
|
"entropy": 0.41092174872756004,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 36.09501961246133,
|
|
"epoch": 0.00013020833333333333,
|
|
"step": 5
|
|
},
|
|
{
|
|
"loss": 0.08963602781295776,
|
|
"grad_norm": 16.086267471313477,
|
|
"learning_rate": 5e-07,
|
|
"num_tokens": 38321.0,
|
|
"completions/mean_length": 106.875,
|
|
"completions/min_length": 30.0,
|
|
"completions/max_length": 191.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 106.875,
|
|
"completions/min_terminated_length": 30.0,
|
|
"completions/max_terminated_length": 191.0,
|
|
"tools/call_frequency": 1.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.008750000037252903,
|
|
"rewards/reward_func/std": 0.018077217042446136,
|
|
"reward": 0.008750000037252903,
|
|
"reward_std": 0.018077215179800987,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.016527945175766945,
|
|
"sampling/sampling_logp_difference/max": 0.5979750156402588,
|
|
"sampling/importance_sampling_ratio/min": 0.6722250580787659,
|
|
"sampling/importance_sampling_ratio/mean": 1.2993158102035522,
|
|
"sampling/importance_sampling_ratio/max": 2.400960922241211,
|
|
"entropy": 0.516218576580286,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 37.64127164706588,
|
|
"epoch": 0.00015625,
|
|
"step": 6
|
|
},
|
|
{
|
|
"loss": -0.34489285945892334,
|
|
"grad_norm": 13.213167190551758,
|
|
"learning_rate": 6e-07,
|
|
"num_tokens": 44748.0,
|
|
"completions/mean_length": 122.375,
|
|
"completions/min_length": 13.0,
|
|
"completions/max_length": 256.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 122.375,
|
|
"completions/min_terminated_length": 13.0,
|
|
"completions/max_terminated_length": 256.0,
|
|
"tools/call_frequency": 2.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.0062500000931322575,
|
|
"rewards/reward_func/std": 0.01767767034471035,
|
|
"reward": 0.0062500000931322575,
|
|
"reward_std": 0.0176776684820652,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.014414949342608452,
|
|
"sampling/sampling_logp_difference/max": 0.250272274017334,
|
|
"sampling/importance_sampling_ratio/min": 0.3499795198440552,
|
|
"sampling/importance_sampling_ratio/mean": 1.1435754299163818,
|
|
"sampling/importance_sampling_ratio/max": 2.296891927719116,
|
|
"entropy": 0.5273875612765551,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 36.501615941524506,
|
|
"epoch": 0.00018229166666666667,
|
|
"step": 7
|
|
},
|
|
{
|
|
"loss": -0.8867464065551758,
|
|
"grad_norm": 39.95463562011719,
|
|
"learning_rate": 7e-07,
|
|
"num_tokens": 50966.0,
|
|
"completions/mean_length": 91.25,
|
|
"completions/min_length": 6.0,
|
|
"completions/max_length": 195.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 91.25,
|
|
"completions/min_terminated_length": 6.0,
|
|
"completions/max_terminated_length": 195.0,
|
|
"tools/call_frequency": 2.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.004999999888241291,
|
|
"rewards/reward_func/std": 0.009258201345801353,
|
|
"reward": 0.004999999888241291,
|
|
"reward_std": 0.009258200414478779,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.015028956346213818,
|
|
"sampling/sampling_logp_difference/max": 0.4996461868286133,
|
|
"sampling/importance_sampling_ratio/min": 0.6598324775695801,
|
|
"sampling/importance_sampling_ratio/mean": 1.2359116077423096,
|
|
"sampling/importance_sampling_ratio/max": 2.9642791748046875,
|
|
"entropy": 0.4555971845984459,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 36.19891104847193,
|
|
"epoch": 0.00020833333333333335,
|
|
"step": 8
|
|
},
|
|
{
|
|
"loss": 0.10192404687404633,
|
|
"grad_norm": 4.609565734863281,
|
|
"learning_rate": 8e-07,
|
|
"num_tokens": 57249.0,
|
|
"completions/mean_length": 102.25,
|
|
"completions/min_length": 6.0,
|
|
"completions/max_length": 279.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 102.25,
|
|
"completions/min_terminated_length": 6.0,
|
|
"completions/max_terminated_length": 279.0,
|
|
"tools/call_frequency": 2.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.0024999999441206455,
|
|
"rewards/reward_func/std": 0.007071067579090595,
|
|
"reward": 0.0024999999441206455,
|
|
"reward_std": 0.007071067579090595,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012550756335258484,
|
|
"sampling/sampling_logp_difference/max": 0.38526344299316406,
|
|
"sampling/importance_sampling_ratio/min": 0.6248411536216736,
|
|
"sampling/importance_sampling_ratio/mean": 0.922042965888977,
|
|
"sampling/importance_sampling_ratio/max": 1.2581053972244263,
|
|
"entropy": 0.5312789976596832,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 36.4501080699265,
|
|
"epoch": 0.000234375,
|
|
"step": 9
|
|
},
|
|
{
|
|
"loss": -0.434135377407074,
|
|
"grad_norm": 8.397831916809082,
|
|
"learning_rate": 9e-07,
|
|
"num_tokens": 63863.0,
|
|
"completions/mean_length": 141.625,
|
|
"completions/min_length": 26.0,
|
|
"completions/max_length": 320.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 141.625,
|
|
"completions/min_terminated_length": 26.0,
|
|
"completions/max_terminated_length": 320.0,
|
|
"tools/call_frequency": 3.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.015000000596046448,
|
|
"rewards/reward_func/std": 0.022677868604660034,
|
|
"reward": 0.015000000596046448,
|
|
"reward_std": 0.022677868604660034,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.014086291193962097,
|
|
"sampling/sampling_logp_difference/max": 0.3863961696624756,
|
|
"sampling/importance_sampling_ratio/min": 0.4828842878341675,
|
|
"sampling/importance_sampling_ratio/mean": 1.0087132453918457,
|
|
"sampling/importance_sampling_ratio/max": 1.504388451576233,
|
|
"entropy": 0.6851713508367538,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 36.92686954140663,
|
|
"epoch": 0.00026041666666666666,
|
|
"step": 10
|
|
},
|
|
{
|
|
"loss": -0.015748508274555206,
|
|
"grad_norm": 6.6033124923706055,
|
|
"learning_rate": 1e-06,
|
|
"num_tokens": 70378.0,
|
|
"completions/mean_length": 131.875,
|
|
"completions/min_length": 36.0,
|
|
"completions/max_length": 293.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 131.875,
|
|
"completions/min_terminated_length": 36.0,
|
|
"completions/max_terminated_length": 293.0,
|
|
"tools/call_frequency": 3.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.008750000037252903,
|
|
"rewards/reward_func/std": 0.018077217042446136,
|
|
"reward": 0.008750000037252903,
|
|
"reward_std": 0.018077215179800987,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013110029511153698,
|
|
"sampling/sampling_logp_difference/max": 0.27173471450805664,
|
|
"sampling/importance_sampling_ratio/min": 0.6055477261543274,
|
|
"sampling/importance_sampling_ratio/mean": 1.0047043561935425,
|
|
"sampling/importance_sampling_ratio/max": 1.881674885749817,
|
|
"entropy": 0.5361065696924925,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 36.50432587787509,
|
|
"epoch": 0.00028645833333333333,
|
|
"step": 11
|
|
},
|
|
{
|
|
"loss": -0.0023724809288978577,
|
|
"grad_norm": 6.656985759735107,
|
|
"learning_rate": 9.96551724137931e-07,
|
|
"num_tokens": 76971.0,
|
|
"completions/mean_length": 138.75,
|
|
"completions/min_length": 39.0,
|
|
"completions/max_length": 270.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 138.75,
|
|
"completions/min_terminated_length": 39.0,
|
|
"completions/max_terminated_length": 270.0,
|
|
"tools/call_frequency": 3.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.016249999403953552,
|
|
"rewards/reward_func/std": 0.01685018092393875,
|
|
"reward": 0.016249999403953552,
|
|
"reward_std": 0.01685018092393875,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011296343058347702,
|
|
"sampling/sampling_logp_difference/max": 0.2637970447540283,
|
|
"sampling/importance_sampling_ratio/min": 0.7121175527572632,
|
|
"sampling/importance_sampling_ratio/mean": 0.8413591384887695,
|
|
"sampling/importance_sampling_ratio/max": 1.2051576375961304,
|
|
"entropy": 0.38445105217397213,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 28.530225463211536,
|
|
"epoch": 0.0003125,
|
|
"step": 12
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 9.93103448275862e-07,
|
|
"num_tokens": 83927.0,
|
|
"completions/mean_length": 185.75,
|
|
"completions/min_length": 31.0,
|
|
"completions/max_length": 335.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 185.75,
|
|
"completions/min_terminated_length": 31.0,
|
|
"completions/max_terminated_length": 335.0,
|
|
"tools/call_frequency": 4.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.0,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.0,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013238866813480854,
|
|
"sampling/sampling_logp_difference/max": 0.4307551383972168,
|
|
"sampling/importance_sampling_ratio/min": 0.47376495599746704,
|
|
"sampling/importance_sampling_ratio/mean": 0.761107325553894,
|
|
"sampling/importance_sampling_ratio/max": 1.2660465240478516,
|
|
"entropy": 0.4054732918739319,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 21.391032822430134,
|
|
"epoch": 0.0003385416666666667,
|
|
"step": 13
|
|
},
|
|
{
|
|
"loss": 0.02079951763153076,
|
|
"grad_norm": 5.232540130615234,
|
|
"learning_rate": 9.89655172413793e-07,
|
|
"num_tokens": 90877.0,
|
|
"completions/mean_length": 183.625,
|
|
"completions/min_length": 37.0,
|
|
"completions/max_length": 281.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 183.625,
|
|
"completions/min_terminated_length": 37.0,
|
|
"completions/max_terminated_length": 281.0,
|
|
"tools/call_frequency": 5.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.011250000447034836,
|
|
"rewards/reward_func/std": 0.018077217042446136,
|
|
"reward": 0.011250000447034836,
|
|
"reward_std": 0.018077215179800987,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01118296105414629,
|
|
"sampling/sampling_logp_difference/max": 0.32562971115112305,
|
|
"sampling/importance_sampling_ratio/min": 0.4047946035861969,
|
|
"sampling/importance_sampling_ratio/mean": 0.8902381658554077,
|
|
"sampling/importance_sampling_ratio/max": 1.861833095550537,
|
|
"entropy": 0.364573635160923,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 20.64675822854042,
|
|
"epoch": 0.00036458333333333335,
|
|
"step": 14
|
|
},
|
|
{
|
|
"loss": -0.17998479306697845,
|
|
"grad_norm": 5.922213077545166,
|
|
"learning_rate": 9.86206896551724e-07,
|
|
"num_tokens": 97908.0,
|
|
"completions/mean_length": 195.875,
|
|
"completions/min_length": 23.0,
|
|
"completions/max_length": 258.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 195.875,
|
|
"completions/min_terminated_length": 23.0,
|
|
"completions/max_terminated_length": 258.0,
|
|
"tools/call_frequency": 5.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.013749999925494194,
|
|
"rewards/reward_func/std": 0.01767767034471035,
|
|
"reward": 0.013749999925494194,
|
|
"reward_std": 0.0176776684820652,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008274673484265804,
|
|
"sampling/sampling_logp_difference/max": 0.5427913665771484,
|
|
"sampling/importance_sampling_ratio/min": 0.49513915181159973,
|
|
"sampling/importance_sampling_ratio/mean": 0.9206554889678955,
|
|
"sampling/importance_sampling_ratio/max": 1.5133479833602905,
|
|
"entropy": 0.2687825821340084,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 21.60207199677825,
|
|
"epoch": 0.000390625,
|
|
"step": 15
|
|
},
|
|
{
|
|
"loss": 0.03240010887384415,
|
|
"grad_norm": 6.687302112579346,
|
|
"learning_rate": 9.82758620689655e-07,
|
|
"num_tokens": 104660.0,
|
|
"completions/mean_length": 160.25,
|
|
"completions/min_length": 64.0,
|
|
"completions/max_length": 269.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 160.25,
|
|
"completions/min_terminated_length": 64.0,
|
|
"completions/max_terminated_length": 269.0,
|
|
"tools/call_frequency": 4.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.008750000037252903,
|
|
"rewards/reward_func/std": 0.018077217042446136,
|
|
"reward": 0.008750000037252903,
|
|
"reward_std": 0.018077215179800987,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011899923905730247,
|
|
"sampling/sampling_logp_difference/max": 0.2562887668609619,
|
|
"sampling/importance_sampling_ratio/min": 0.6062029004096985,
|
|
"sampling/importance_sampling_ratio/mean": 1.1879191398620605,
|
|
"sampling/importance_sampling_ratio/max": 2.131728172302246,
|
|
"entropy": 0.3837167005985975,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 20.831536203622818,
|
|
"epoch": 0.0004166666666666667,
|
|
"step": 16
|
|
},
|
|
{
|
|
"loss": -0.15749281644821167,
|
|
"grad_norm": 6.5017170906066895,
|
|
"learning_rate": 9.79310344827586e-07,
|
|
"num_tokens": 111275.0,
|
|
"completions/mean_length": 141.5,
|
|
"completions/min_length": 35.0,
|
|
"completions/max_length": 235.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 141.5,
|
|
"completions/min_terminated_length": 35.0,
|
|
"completions/max_terminated_length": 235.0,
|
|
"tools/call_frequency": 3.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.019999999552965164,
|
|
"rewards/reward_func/std": 0.020701967179775238,
|
|
"reward": 0.019999999552965164,
|
|
"reward_std": 0.020701967179775238,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009790186770260334,
|
|
"sampling/sampling_logp_difference/max": 0.2380383014678955,
|
|
"sampling/importance_sampling_ratio/min": 0.6131651997566223,
|
|
"sampling/importance_sampling_ratio/mean": 1.048501968383789,
|
|
"sampling/importance_sampling_ratio/max": 1.4037240743637085,
|
|
"entropy": 0.37214965745806694,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 20.402552723884583,
|
|
"epoch": 0.0004427083333333333,
|
|
"step": 17
|
|
},
|
|
{
|
|
"loss": -0.043051980435848236,
|
|
"grad_norm": 5.14762020111084,
|
|
"learning_rate": 9.75862068965517e-07,
|
|
"num_tokens": 118213.0,
|
|
"completions/mean_length": 181.875,
|
|
"completions/min_length": 44.0,
|
|
"completions/max_length": 233.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 181.875,
|
|
"completions/min_terminated_length": 44.0,
|
|
"completions/max_terminated_length": 233.0,
|
|
"tools/call_frequency": 5.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.007499999832361937,
|
|
"rewards/reward_func/std": 0.010350983589887619,
|
|
"reward": 0.007499999832361937,
|
|
"reward_std": 0.010350982658565044,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011298970319330692,
|
|
"sampling/sampling_logp_difference/max": 0.25880563259124756,
|
|
"sampling/importance_sampling_ratio/min": 0.4977272152900696,
|
|
"sampling/importance_sampling_ratio/mean": 0.8073327541351318,
|
|
"sampling/importance_sampling_ratio/max": 1.208906888961792,
|
|
"entropy": 0.34852655604481697,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 20.707383673638105,
|
|
"epoch": 0.00046875,
|
|
"step": 18
|
|
},
|
|
{
|
|
"loss": -0.14468500018119812,
|
|
"grad_norm": 5.45598840713501,
|
|
"learning_rate": 9.72413793103448e-07,
|
|
"num_tokens": 124974.0,
|
|
"completions/mean_length": 159.75,
|
|
"completions/min_length": 98.0,
|
|
"completions/max_length": 223.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 159.75,
|
|
"completions/min_terminated_length": 98.0,
|
|
"completions/max_terminated_length": 223.0,
|
|
"tools/call_frequency": 4.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.032499998807907104,
|
|
"rewards/reward_func/std": 0.019820624962449074,
|
|
"reward": 0.032499998807907104,
|
|
"reward_std": 0.019820624962449074,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.00898817740380764,
|
|
"sampling/sampling_logp_difference/max": 0.3447690010070801,
|
|
"sampling/importance_sampling_ratio/min": 0.5387510061264038,
|
|
"sampling/importance_sampling_ratio/mean": 0.8799911737442017,
|
|
"sampling/importance_sampling_ratio/max": 1.6199899911880493,
|
|
"entropy": 0.34017826430499554,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 20.64898883551359,
|
|
"epoch": 0.0004947916666666667,
|
|
"step": 19
|
|
},
|
|
{
|
|
"loss": -0.06275665760040283,
|
|
"grad_norm": 8.189361572265625,
|
|
"learning_rate": 9.689655172413793e-07,
|
|
"num_tokens": 131762.0,
|
|
"completions/mean_length": 163.375,
|
|
"completions/min_length": 72.0,
|
|
"completions/max_length": 278.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 163.375,
|
|
"completions/min_terminated_length": 72.0,
|
|
"completions/max_terminated_length": 278.0,
|
|
"tools/call_frequency": 3.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.01875000074505806,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.01875000074505806,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012297180481255054,
|
|
"sampling/sampling_logp_difference/max": 0.2399139404296875,
|
|
"sampling/importance_sampling_ratio/min": 0.36634376645088196,
|
|
"sampling/importance_sampling_ratio/mean": 1.0522818565368652,
|
|
"sampling/importance_sampling_ratio/max": 1.9464819431304932,
|
|
"entropy": 0.4162163510918617,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 20.708322688937187,
|
|
"epoch": 0.0005208333333333333,
|
|
"step": 20
|
|
},
|
|
{
|
|
"loss": -0.04717805236577988,
|
|
"grad_norm": 4.736361503601074,
|
|
"learning_rate": 9.655172413793103e-07,
|
|
"num_tokens": 138434.0,
|
|
"completions/mean_length": 148.875,
|
|
"completions/min_length": 39.0,
|
|
"completions/max_length": 232.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 148.875,
|
|
"completions/min_terminated_length": 39.0,
|
|
"completions/max_terminated_length": 232.0,
|
|
"tools/call_frequency": 4.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.02250000089406967,
|
|
"rewards/reward_func/std": 0.019086269661784172,
|
|
"reward": 0.02250000089406967,
|
|
"reward_std": 0.019086269661784172,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009806210175156593,
|
|
"sampling/sampling_logp_difference/max": 0.3546772003173828,
|
|
"sampling/importance_sampling_ratio/min": 0.49156516790390015,
|
|
"sampling/importance_sampling_ratio/mean": 0.854424238204956,
|
|
"sampling/importance_sampling_ratio/max": 1.5377742052078247,
|
|
"entropy": 0.3397639747709036,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 20.957030817866325,
|
|
"epoch": 0.000546875,
|
|
"step": 21
|
|
},
|
|
{
|
|
"loss": 0.10890503972768784,
|
|
"grad_norm": 8.61061954498291,
|
|
"learning_rate": 9.620689655172413e-07,
|
|
"num_tokens": 144977.0,
|
|
"completions/mean_length": 132.75,
|
|
"completions/min_length": 58.0,
|
|
"completions/max_length": 219.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 132.75,
|
|
"completions/min_terminated_length": 58.0,
|
|
"completions/max_terminated_length": 219.0,
|
|
"tools/call_frequency": 3.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.023749999701976776,
|
|
"rewards/reward_func/std": 0.025599945336580276,
|
|
"reward": 0.023749999701976776,
|
|
"reward_std": 0.025599945336580276,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.006962330546230078,
|
|
"sampling/sampling_logp_difference/max": 0.16659164428710938,
|
|
"sampling/importance_sampling_ratio/min": 0.6960119009017944,
|
|
"sampling/importance_sampling_ratio/mean": 1.0722699165344238,
|
|
"sampling/importance_sampling_ratio/max": 1.4663054943084717,
|
|
"entropy": 0.3046452794224024,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 20.846546791493893,
|
|
"epoch": 0.0005729166666666667,
|
|
"step": 22
|
|
},
|
|
{
|
|
"loss": 0.05462484061717987,
|
|
"grad_norm": 6.245155334472656,
|
|
"learning_rate": 9.586206896551724e-07,
|
|
"num_tokens": 151760.0,
|
|
"completions/mean_length": 162.125,
|
|
"completions/min_length": 91.0,
|
|
"completions/max_length": 253.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 162.125,
|
|
"completions/min_terminated_length": 91.0,
|
|
"completions/max_terminated_length": 253.0,
|
|
"tools/call_frequency": 4.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.028750000521540642,
|
|
"rewards/reward_func/std": 0.018850920721888542,
|
|
"reward": 0.028750000521540642,
|
|
"reward_std": 0.018850918859243393,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010342186316847801,
|
|
"sampling/sampling_logp_difference/max": 0.5263607501983643,
|
|
"sampling/importance_sampling_ratio/min": 0.7085199952125549,
|
|
"sampling/importance_sampling_ratio/mean": 0.9503569602966309,
|
|
"sampling/importance_sampling_ratio/max": 1.2953131198883057,
|
|
"entropy": 0.3539642468094826,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 21.316515784710646,
|
|
"epoch": 0.0005989583333333333,
|
|
"step": 23
|
|
},
|
|
{
|
|
"loss": 0.10025905817747116,
|
|
"grad_norm": 7.867324352264404,
|
|
"learning_rate": 9.551724137931034e-07,
|
|
"num_tokens": 158416.0,
|
|
"completions/mean_length": 149.0,
|
|
"completions/min_length": 30.0,
|
|
"completions/max_length": 231.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 149.0,
|
|
"completions/min_terminated_length": 30.0,
|
|
"completions/max_terminated_length": 231.0,
|
|
"tools/call_frequency": 4.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.021250000223517418,
|
|
"rewards/reward_func/std": 0.02695896476507187,
|
|
"reward": 0.021250000223517418,
|
|
"reward_std": 0.02695896476507187,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.00749181117862463,
|
|
"sampling/sampling_logp_difference/max": 0.22932815551757812,
|
|
"sampling/importance_sampling_ratio/min": 0.44922351837158203,
|
|
"sampling/importance_sampling_ratio/mean": 1.052233338356018,
|
|
"sampling/importance_sampling_ratio/max": 1.6336404085159302,
|
|
"entropy": 0.28345833718776703,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 20.681581370532513,
|
|
"epoch": 0.000625,
|
|
"step": 24
|
|
},
|
|
{
|
|
"loss": -0.08836822211742401,
|
|
"grad_norm": 5.426852226257324,
|
|
"learning_rate": 9.517241379310345e-07,
|
|
"num_tokens": 165000.0,
|
|
"completions/mean_length": 139.875,
|
|
"completions/min_length": 47.0,
|
|
"completions/max_length": 230.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 139.875,
|
|
"completions/min_terminated_length": 47.0,
|
|
"completions/max_terminated_length": 230.0,
|
|
"tools/call_frequency": 4.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.028750000521540642,
|
|
"rewards/reward_func/std": 0.018850920721888542,
|
|
"reward": 0.028750000521540642,
|
|
"reward_std": 0.018850918859243393,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009383185766637325,
|
|
"sampling/sampling_logp_difference/max": 0.33803892135620117,
|
|
"sampling/importance_sampling_ratio/min": 0.5007726550102234,
|
|
"sampling/importance_sampling_ratio/mean": 0.8847082257270813,
|
|
"sampling/importance_sampling_ratio/max": 1.2992891073226929,
|
|
"entropy": 0.30262799747288227,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 20.605320628732443,
|
|
"epoch": 0.0006510416666666666,
|
|
"step": 25
|
|
},
|
|
{
|
|
"loss": -0.0026366226375102997,
|
|
"grad_norm": 4.845335960388184,
|
|
"learning_rate": 9.482758620689655e-07,
|
|
"num_tokens": 171435.0,
|
|
"completions/mean_length": 121.25,
|
|
"completions/min_length": 45.0,
|
|
"completions/max_length": 219.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 121.25,
|
|
"completions/min_terminated_length": 45.0,
|
|
"completions/max_terminated_length": 219.0,
|
|
"tools/call_frequency": 3.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.01875000074505806,
|
|
"rewards/reward_func/std": 0.015526474453508854,
|
|
"reward": 0.01875000074505806,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008715836331248283,
|
|
"sampling/sampling_logp_difference/max": 0.22706031799316406,
|
|
"sampling/importance_sampling_ratio/min": 0.4022264778614044,
|
|
"sampling/importance_sampling_ratio/mean": 0.8477516770362854,
|
|
"sampling/importance_sampling_ratio/max": 1.6113998889923096,
|
|
"entropy": 0.32572532072663307,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 20.443785045295954,
|
|
"epoch": 0.0006770833333333334,
|
|
"step": 26
|
|
},
|
|
{
|
|
"loss": 0.03460419178009033,
|
|
"grad_norm": 5.734435558319092,
|
|
"learning_rate": 9.448275862068965e-07,
|
|
"num_tokens": 178352.0,
|
|
"completions/mean_length": 178.625,
|
|
"completions/min_length": 55.0,
|
|
"completions/max_length": 237.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 178.625,
|
|
"completions/min_terminated_length": 55.0,
|
|
"completions/max_terminated_length": 237.0,
|
|
"tools/call_frequency": 5.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.023749999701976776,
|
|
"rewards/reward_func/std": 0.025599945336580276,
|
|
"reward": 0.023749999701976776,
|
|
"reward_std": 0.025599945336580276,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009394889697432518,
|
|
"sampling/sampling_logp_difference/max": 0.2116551399230957,
|
|
"sampling/importance_sampling_ratio/min": 0.6561595797538757,
|
|
"sampling/importance_sampling_ratio/mean": 1.0656712055206299,
|
|
"sampling/importance_sampling_ratio/max": 1.9904744625091553,
|
|
"entropy": 0.3666235599666834,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 21.021979205310345,
|
|
"epoch": 0.000703125,
|
|
"step": 27
|
|
},
|
|
{
|
|
"loss": -0.22922024130821228,
|
|
"grad_norm": 8.727387428283691,
|
|
"learning_rate": 9.413793103448276e-07,
|
|
"num_tokens": 184907.0,
|
|
"completions/mean_length": 133.875,
|
|
"completions/min_length": 57.0,
|
|
"completions/max_length": 211.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 133.875,
|
|
"completions/min_terminated_length": 57.0,
|
|
"completions/max_terminated_length": 211.0,
|
|
"tools/call_frequency": 3.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.02250000089406967,
|
|
"rewards/reward_func/std": 0.019086269661784172,
|
|
"reward": 0.02250000089406967,
|
|
"reward_std": 0.019086269661784172,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.00895582977682352,
|
|
"sampling/sampling_logp_difference/max": 0.24191522598266602,
|
|
"sampling/importance_sampling_ratio/min": 0.5283964276313782,
|
|
"sampling/importance_sampling_ratio/mean": 0.9204263687133789,
|
|
"sampling/importance_sampling_ratio/max": 1.3373774290084839,
|
|
"entropy": 0.36481352895498276,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 20.425370667129755,
|
|
"epoch": 0.0007291666666666667,
|
|
"step": 28
|
|
},
|
|
{
|
|
"loss": -0.01819920912384987,
|
|
"grad_norm": 5.154520511627197,
|
|
"learning_rate": 9.379310344827586e-07,
|
|
"num_tokens": 191496.0,
|
|
"completions/mean_length": 139.75,
|
|
"completions/min_length": 46.0,
|
|
"completions/max_length": 198.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 139.75,
|
|
"completions/min_terminated_length": 46.0,
|
|
"completions/max_terminated_length": 198.0,
|
|
"tools/call_frequency": 3.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.01875000074505806,
|
|
"rewards/reward_func/std": 0.015526474453508854,
|
|
"reward": 0.01875000074505806,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008894074708223343,
|
|
"sampling/sampling_logp_difference/max": 0.22660303115844727,
|
|
"sampling/importance_sampling_ratio/min": 0.41451773047447205,
|
|
"sampling/importance_sampling_ratio/mean": 0.8284684419631958,
|
|
"sampling/importance_sampling_ratio/max": 1.5668686628341675,
|
|
"entropy": 0.3417188785970211,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 20.44797110557556,
|
|
"epoch": 0.0007552083333333333,
|
|
"step": 29
|
|
},
|
|
{
|
|
"loss": -0.20519858598709106,
|
|
"grad_norm": 5.991239070892334,
|
|
"learning_rate": 9.344827586206896e-07,
|
|
"num_tokens": 198263.0,
|
|
"completions/mean_length": 160.25,
|
|
"completions/min_length": 41.0,
|
|
"completions/max_length": 253.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 160.25,
|
|
"completions/min_terminated_length": 41.0,
|
|
"completions/max_terminated_length": 253.0,
|
|
"tools/call_frequency": 4.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.032499998807907104,
|
|
"rewards/reward_func/std": 0.019820624962449074,
|
|
"reward": 0.032499998807907104,
|
|
"reward_std": 0.019820624962449074,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009669131599366665,
|
|
"sampling/sampling_logp_difference/max": 0.23380827903747559,
|
|
"sampling/importance_sampling_ratio/min": 0.6005908846855164,
|
|
"sampling/importance_sampling_ratio/mean": 0.9316152930259705,
|
|
"sampling/importance_sampling_ratio/max": 1.503471851348877,
|
|
"entropy": 0.3355466667562723,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 21.340124938637018,
|
|
"epoch": 0.00078125,
|
|
"step": 30
|
|
},
|
|
{
|
|
"loss": -0.01702813431620598,
|
|
"grad_norm": 7.362905502319336,
|
|
"learning_rate": 9.310344827586206e-07,
|
|
"num_tokens": 204824.0,
|
|
"completions/mean_length": 134.75,
|
|
"completions/min_length": 92.0,
|
|
"completions/max_length": 228.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 134.75,
|
|
"completions/min_terminated_length": 92.0,
|
|
"completions/max_terminated_length": 228.0,
|
|
"tools/call_frequency": 3.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.036250002682209015,
|
|
"rewards/reward_func/std": 0.019955307245254517,
|
|
"reward": 0.036250002682209015,
|
|
"reward_std": 0.019955307245254517,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009860306978225708,
|
|
"sampling/sampling_logp_difference/max": 0.3035142421722412,
|
|
"sampling/importance_sampling_ratio/min": 0.5170778036117554,
|
|
"sampling/importance_sampling_ratio/mean": 0.9038935899734497,
|
|
"sampling/importance_sampling_ratio/max": 1.1554527282714844,
|
|
"entropy": 0.3615808691829443,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 20.256591100245714,
|
|
"epoch": 0.0008072916666666667,
|
|
"step": 31
|
|
},
|
|
{
|
|
"loss": -0.032833755016326904,
|
|
"grad_norm": 4.283570766448975,
|
|
"learning_rate": 9.275862068965516e-07,
|
|
"num_tokens": 211429.0,
|
|
"completions/mean_length": 142.125,
|
|
"completions/min_length": 44.0,
|
|
"completions/max_length": 220.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 142.125,
|
|
"completions/min_terminated_length": 44.0,
|
|
"completions/max_terminated_length": 220.0,
|
|
"tools/call_frequency": 3.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.032499998807907104,
|
|
"rewards/reward_func/std": 0.019820624962449074,
|
|
"reward": 0.032499998807907104,
|
|
"reward_std": 0.019820624962449074,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009062220342457294,
|
|
"sampling/sampling_logp_difference/max": 0.22057127952575684,
|
|
"sampling/importance_sampling_ratio/min": 0.6157566905021667,
|
|
"sampling/importance_sampling_ratio/mean": 0.8454524278640747,
|
|
"sampling/importance_sampling_ratio/max": 1.1623364686965942,
|
|
"entropy": 0.3047413844615221,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 20.30556419491768,
|
|
"epoch": 0.0008333333333333334,
|
|
"step": 32
|
|
},
|
|
{
|
|
"loss": -0.1124148815870285,
|
|
"grad_norm": 5.204093933105469,
|
|
"learning_rate": 9.241379310344826e-07,
|
|
"num_tokens": 218476.0,
|
|
"completions/mean_length": 194.125,
|
|
"completions/min_length": 35.0,
|
|
"completions/max_length": 258.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 194.125,
|
|
"completions/min_terminated_length": 35.0,
|
|
"completions/max_terminated_length": 258.0,
|
|
"tools/call_frequency": 5.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.021250000223517418,
|
|
"rewards/reward_func/std": 0.013562027364969254,
|
|
"reward": 0.021250000223517418,
|
|
"reward_std": 0.013562026433646679,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011322963051497936,
|
|
"sampling/sampling_logp_difference/max": 0.33586275577545166,
|
|
"sampling/importance_sampling_ratio/min": 0.4237613081932068,
|
|
"sampling/importance_sampling_ratio/mean": 1.0884665250778198,
|
|
"sampling/importance_sampling_ratio/max": 1.9433987140655518,
|
|
"entropy": 0.3970138616859913,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 20.684372786432505,
|
|
"epoch": 0.000859375,
|
|
"step": 33
|
|
},
|
|
{
|
|
"loss": 0.3120284378528595,
|
|
"grad_norm": 5.788089275360107,
|
|
"learning_rate": 9.206896551724138e-07,
|
|
"num_tokens": 225237.0,
|
|
"completions/mean_length": 158.875,
|
|
"completions/min_length": 89.0,
|
|
"completions/max_length": 238.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 158.875,
|
|
"completions/min_terminated_length": 89.0,
|
|
"completions/max_terminated_length": 238.0,
|
|
"tools/call_frequency": 4.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.027499999850988388,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.027499999850988388,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008865631185472012,
|
|
"sampling/sampling_logp_difference/max": 0.2181529998779297,
|
|
"sampling/importance_sampling_ratio/min": 0.6731056571006775,
|
|
"sampling/importance_sampling_ratio/mean": 1.1323657035827637,
|
|
"sampling/importance_sampling_ratio/max": 1.9685696363449097,
|
|
"entropy": 0.31718801334500313,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 12.480241607874632,
|
|
"epoch": 0.0008854166666666666,
|
|
"step": 34
|
|
},
|
|
{
|
|
"loss": -0.01565421000123024,
|
|
"grad_norm": 4.152030944824219,
|
|
"learning_rate": 9.172413793103448e-07,
|
|
"num_tokens": 232228.0,
|
|
"completions/mean_length": 188.375,
|
|
"completions/min_length": 110.0,
|
|
"completions/max_length": 234.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 188.375,
|
|
"completions/min_terminated_length": 110.0,
|
|
"completions/max_terminated_length": 234.0,
|
|
"tools/call_frequency": 5.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.007795717567205429,
|
|
"sampling/sampling_logp_difference/max": 0.25260043144226074,
|
|
"sampling/importance_sampling_ratio/min": 0.5036969184875488,
|
|
"sampling/importance_sampling_ratio/mean": 0.7785353660583496,
|
|
"sampling/importance_sampling_ratio/max": 1.1340864896774292,
|
|
"entropy": 0.28588490188121796,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.830931171774864,
|
|
"epoch": 0.0009114583333333333,
|
|
"step": 35
|
|
},
|
|
{
|
|
"loss": -0.03426661342382431,
|
|
"grad_norm": 6.349575042724609,
|
|
"learning_rate": 9.137931034482759e-07,
|
|
"num_tokens": 239060.0,
|
|
"completions/mean_length": 168.375,
|
|
"completions/min_length": 92.0,
|
|
"completions/max_length": 244.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 168.375,
|
|
"completions/min_terminated_length": 92.0,
|
|
"completions/max_terminated_length": 244.0,
|
|
"tools/call_frequency": 4.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.026250001043081284,
|
|
"rewards/reward_func/std": 0.02386719174683094,
|
|
"reward": 0.026250001043081284,
|
|
"reward_std": 0.02386719174683094,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.007818865589797497,
|
|
"sampling/sampling_logp_difference/max": 0.2404015064239502,
|
|
"sampling/importance_sampling_ratio/min": 0.7001102566719055,
|
|
"sampling/importance_sampling_ratio/mean": 1.0841290950775146,
|
|
"sampling/importance_sampling_ratio/max": 1.383851408958435,
|
|
"entropy": 0.2678183987736702,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.062030844390392,
|
|
"epoch": 0.0009375,
|
|
"step": 36
|
|
},
|
|
{
|
|
"loss": 0.35137784481048584,
|
|
"grad_norm": 7.164522647857666,
|
|
"learning_rate": 9.103448275862069e-07,
|
|
"num_tokens": 245858.0,
|
|
"completions/mean_length": 162.875,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 258.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 162.875,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 258.0,
|
|
"tools/call_frequency": 4.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03125,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.03125,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011881194077432156,
|
|
"sampling/sampling_logp_difference/max": 0.3850877285003662,
|
|
"sampling/importance_sampling_ratio/min": 0.5915504693984985,
|
|
"sampling/importance_sampling_ratio/mean": 0.9095719456672668,
|
|
"sampling/importance_sampling_ratio/max": 2.0288326740264893,
|
|
"entropy": 0.36159021966159344,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.889691513031721,
|
|
"epoch": 0.0009635416666666667,
|
|
"step": 37
|
|
},
|
|
{
|
|
"loss": -0.10781438648700714,
|
|
"grad_norm": 7.6127543449401855,
|
|
"learning_rate": 9.068965517241379e-07,
|
|
"num_tokens": 252586.0,
|
|
"completions/mean_length": 154.875,
|
|
"completions/min_length": 79.0,
|
|
"completions/max_length": 248.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 154.875,
|
|
"completions/min_terminated_length": 79.0,
|
|
"completions/max_terminated_length": 248.0,
|
|
"tools/call_frequency": 3.625,
|
|
"tools/failure_frequency": 0.03448275849223137,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010863994248211384,
|
|
"sampling/sampling_logp_difference/max": 0.5725090503692627,
|
|
"sampling/importance_sampling_ratio/min": 0.524786651134491,
|
|
"sampling/importance_sampling_ratio/mean": 0.905246376991272,
|
|
"sampling/importance_sampling_ratio/max": 1.6983059644699097,
|
|
"entropy": 0.3136354796588421,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 6.001252330839634,
|
|
"epoch": 0.0009895833333333334,
|
|
"step": 38
|
|
},
|
|
{
|
|
"loss": -0.09975679963827133,
|
|
"grad_norm": 6.176290035247803,
|
|
"learning_rate": 9.034482758620689e-07,
|
|
"num_tokens": 259001.0,
|
|
"completions/mean_length": 115.625,
|
|
"completions/min_length": 45.0,
|
|
"completions/max_length": 228.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 115.625,
|
|
"completions/min_terminated_length": 45.0,
|
|
"completions/max_terminated_length": 228.0,
|
|
"tools/call_frequency": 2.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.030000001192092896,
|
|
"rewards/reward_func/std": 0.022677868604660034,
|
|
"reward": 0.030000001192092896,
|
|
"reward_std": 0.022677868604660034,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.00891152024269104,
|
|
"sampling/sampling_logp_difference/max": 0.3750847578048706,
|
|
"sampling/importance_sampling_ratio/min": 0.639533281326294,
|
|
"sampling/importance_sampling_ratio/mean": 0.8951395750045776,
|
|
"sampling/importance_sampling_ratio/max": 1.2477972507476807,
|
|
"entropy": 0.24010402336716652,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.6655657440423965,
|
|
"epoch": 0.001015625,
|
|
"step": 39
|
|
},
|
|
{
|
|
"loss": 0.13084544241428375,
|
|
"grad_norm": 6.87970495223999,
|
|
"learning_rate": 9e-07,
|
|
"num_tokens": 265401.0,
|
|
"completions/mean_length": 114.375,
|
|
"completions/min_length": 76.0,
|
|
"completions/max_length": 193.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 114.375,
|
|
"completions/min_terminated_length": 76.0,
|
|
"completions/max_terminated_length": 193.0,
|
|
"tools/call_frequency": 2.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.00781896524131298,
|
|
"sampling/sampling_logp_difference/max": 0.19175148010253906,
|
|
"sampling/importance_sampling_ratio/min": 0.7254706025123596,
|
|
"sampling/importance_sampling_ratio/mean": 0.963738203048706,
|
|
"sampling/importance_sampling_ratio/max": 1.148192048072815,
|
|
"entropy": 0.26008577831089497,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.308024551719427,
|
|
"epoch": 0.0010416666666666667,
|
|
"step": 40
|
|
},
|
|
{
|
|
"loss": -0.054356008768081665,
|
|
"grad_norm": 5.049872875213623,
|
|
"learning_rate": 8.96551724137931e-07,
|
|
"num_tokens": 272181.0,
|
|
"completions/mean_length": 161.75,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 246.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 161.75,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 246.0,
|
|
"tools/call_frequency": 4.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03125,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.03125,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01043853908777237,
|
|
"sampling/sampling_logp_difference/max": 0.4462606906890869,
|
|
"sampling/importance_sampling_ratio/min": 0.38138890266418457,
|
|
"sampling/importance_sampling_ratio/mean": 0.7119714617729187,
|
|
"sampling/importance_sampling_ratio/max": 1.171438455581665,
|
|
"entropy": 0.3081154990941286,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.617127258330584,
|
|
"epoch": 0.0010677083333333333,
|
|
"step": 41
|
|
},
|
|
{
|
|
"loss": 0.10210782289505005,
|
|
"grad_norm": 6.514715194702148,
|
|
"learning_rate": 8.93103448275862e-07,
|
|
"num_tokens": 278770.0,
|
|
"completions/mean_length": 137.5,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 243.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 137.5,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 243.0,
|
|
"tools/call_frequency": 3.625,
|
|
"tools/failure_frequency": 0.03448275849223137,
|
|
"rewards/reward_func/mean": 0.03125,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.03125,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010128241032361984,
|
|
"sampling/sampling_logp_difference/max": 0.24643254280090332,
|
|
"sampling/importance_sampling_ratio/min": 0.5159069299697876,
|
|
"sampling/importance_sampling_ratio/mean": 0.8559343814849854,
|
|
"sampling/importance_sampling_ratio/max": 1.3772742748260498,
|
|
"entropy": 0.2935776449739933,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.669547338038683,
|
|
"epoch": 0.00109375,
|
|
"step": 42
|
|
},
|
|
{
|
|
"loss": 0.3554345965385437,
|
|
"grad_norm": 8.031490325927734,
|
|
"learning_rate": 8.896551724137931e-07,
|
|
"num_tokens": 285494.0,
|
|
"completions/mean_length": 154.875,
|
|
"completions/min_length": 92.0,
|
|
"completions/max_length": 218.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 154.875,
|
|
"completions/min_terminated_length": 92.0,
|
|
"completions/max_terminated_length": 218.0,
|
|
"tools/call_frequency": 4.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008680367842316628,
|
|
"sampling/sampling_logp_difference/max": 0.3858180046081543,
|
|
"sampling/importance_sampling_ratio/min": 0.5469220876693726,
|
|
"sampling/importance_sampling_ratio/mean": 1.0541657209396362,
|
|
"sampling/importance_sampling_ratio/max": 1.5864670276641846,
|
|
"entropy": 0.27114896662533283,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.974387422204018,
|
|
"epoch": 0.0011197916666666667,
|
|
"step": 43
|
|
},
|
|
{
|
|
"loss": 0.10589627176523209,
|
|
"grad_norm": 5.162812232971191,
|
|
"learning_rate": 8.862068965517241e-07,
|
|
"num_tokens": 292356.0,
|
|
"completions/mean_length": 172.125,
|
|
"completions/min_length": 115.0,
|
|
"completions/max_length": 248.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 172.125,
|
|
"completions/min_terminated_length": 115.0,
|
|
"completions/max_terminated_length": 248.0,
|
|
"tools/call_frequency": 5.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.026250001043081284,
|
|
"rewards/reward_func/std": 0.02386719174683094,
|
|
"reward": 0.026250001043081284,
|
|
"reward_std": 0.02386719174683094,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.007868079468607903,
|
|
"sampling/sampling_logp_difference/max": 0.24561452865600586,
|
|
"sampling/importance_sampling_ratio/min": 0.6875799298286438,
|
|
"sampling/importance_sampling_ratio/mean": 1.0054194927215576,
|
|
"sampling/importance_sampling_ratio/max": 1.3888652324676514,
|
|
"entropy": 0.2661617901176214,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.709124103188515,
|
|
"epoch": 0.0011458333333333333,
|
|
"step": 44
|
|
},
|
|
{
|
|
"loss": -0.0591389499604702,
|
|
"grad_norm": 7.834764003753662,
|
|
"learning_rate": 8.827586206896551e-07,
|
|
"num_tokens": 299027.0,
|
|
"completions/mean_length": 147.75,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 226.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 147.75,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 226.0,
|
|
"tools/call_frequency": 3.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009236816316843033,
|
|
"sampling/sampling_logp_difference/max": 0.5252978801727295,
|
|
"sampling/importance_sampling_ratio/min": 0.35149699449539185,
|
|
"sampling/importance_sampling_ratio/mean": 1.1181907653808594,
|
|
"sampling/importance_sampling_ratio/max": 1.6860265731811523,
|
|
"entropy": 0.278241541236639,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.473275948315859,
|
|
"epoch": 0.001171875,
|
|
"step": 45
|
|
},
|
|
{
|
|
"loss": -0.27108079195022583,
|
|
"grad_norm": 2.7441484928131104,
|
|
"learning_rate": 8.793103448275862e-07,
|
|
"num_tokens": 305938.0,
|
|
"completions/mean_length": 178.25,
|
|
"completions/min_length": 43.0,
|
|
"completions/max_length": 234.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 178.25,
|
|
"completions/min_terminated_length": 43.0,
|
|
"completions/max_terminated_length": 234.0,
|
|
"tools/call_frequency": 5.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.017500000074505806,
|
|
"rewards/reward_func/std": 0.007071067579090595,
|
|
"reward": 0.017500000074505806,
|
|
"reward_std": 0.007071067579090595,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008638064377009869,
|
|
"sampling/sampling_logp_difference/max": 0.31515026092529297,
|
|
"sampling/importance_sampling_ratio/min": 0.5775101184844971,
|
|
"sampling/importance_sampling_ratio/mean": 0.8990919589996338,
|
|
"sampling/importance_sampling_ratio/max": 2.1571614742279053,
|
|
"entropy": 0.2913599815219641,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.4653757363557816,
|
|
"epoch": 0.0011979166666666666,
|
|
"step": 46
|
|
},
|
|
{
|
|
"loss": 0.4079431891441345,
|
|
"grad_norm": 8.527111053466797,
|
|
"learning_rate": 8.758620689655172e-07,
|
|
"num_tokens": 312575.0,
|
|
"completions/mean_length": 144.0,
|
|
"completions/min_length": 78.0,
|
|
"completions/max_length": 223.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 144.0,
|
|
"completions/min_terminated_length": 78.0,
|
|
"completions/max_terminated_length": 223.0,
|
|
"tools/call_frequency": 3.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009136517532169819,
|
|
"sampling/sampling_logp_difference/max": 0.22486400604248047,
|
|
"sampling/importance_sampling_ratio/min": 0.5707057118415833,
|
|
"sampling/importance_sampling_ratio/mean": 1.077945351600647,
|
|
"sampling/importance_sampling_ratio/max": 1.7271728515625,
|
|
"entropy": 0.2839373517781496,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.54995883256197,
|
|
"epoch": 0.0012239583333333334,
|
|
"step": 47
|
|
},
|
|
{
|
|
"loss": 0.4644259214401245,
|
|
"grad_norm": 8.421874046325684,
|
|
"learning_rate": 8.724137931034482e-07,
|
|
"num_tokens": 319242.0,
|
|
"completions/mean_length": 146.75,
|
|
"completions/min_length": 73.0,
|
|
"completions/max_length": 215.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 146.75,
|
|
"completions/min_terminated_length": 73.0,
|
|
"completions/max_terminated_length": 215.0,
|
|
"tools/call_frequency": 3.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03125,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.03125,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011644345708191395,
|
|
"sampling/sampling_logp_difference/max": 0.30409717559814453,
|
|
"sampling/importance_sampling_ratio/min": 0.32547813653945923,
|
|
"sampling/importance_sampling_ratio/mean": 1.2393231391906738,
|
|
"sampling/importance_sampling_ratio/max": 2.443915367126465,
|
|
"entropy": 0.3517550267279148,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.6201141737401485,
|
|
"epoch": 0.00125,
|
|
"step": 48
|
|
},
|
|
{
|
|
"loss": 0.49574077129364014,
|
|
"grad_norm": 18.6467342376709,
|
|
"learning_rate": 8.689655172413792e-07,
|
|
"num_tokens": 325552.0,
|
|
"completions/mean_length": 102.375,
|
|
"completions/min_length": 66.0,
|
|
"completions/max_length": 214.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 102.375,
|
|
"completions/min_terminated_length": 66.0,
|
|
"completions/max_terminated_length": 214.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010042176581919193,
|
|
"sampling/sampling_logp_difference/max": 0.3463928699493408,
|
|
"sampling/importance_sampling_ratio/min": 0.6331563591957092,
|
|
"sampling/importance_sampling_ratio/mean": 1.3004318475723267,
|
|
"sampling/importance_sampling_ratio/max": 2.691237688064575,
|
|
"entropy": 0.2693322170525789,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.315858248621225,
|
|
"epoch": 0.0012760416666666666,
|
|
"step": 49
|
|
},
|
|
{
|
|
"loss": -0.03001394122838974,
|
|
"grad_norm": 8.571084022521973,
|
|
"learning_rate": 8.655172413793102e-07,
|
|
"num_tokens": 332066.0,
|
|
"completions/mean_length": 129.0,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 201.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 129.0,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 201.0,
|
|
"tools/call_frequency": 3.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03125,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.03125,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008165487088263035,
|
|
"sampling/sampling_logp_difference/max": 0.1741194725036621,
|
|
"sampling/importance_sampling_ratio/min": 0.3725735545158386,
|
|
"sampling/importance_sampling_ratio/mean": 0.9180060029029846,
|
|
"sampling/importance_sampling_ratio/max": 1.2996761798858643,
|
|
"entropy": 0.2941217888146639,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.545101586729288,
|
|
"epoch": 0.0013020833333333333,
|
|
"step": 50
|
|
},
|
|
{
|
|
"loss": 0.16267147660255432,
|
|
"grad_norm": 6.111854553222656,
|
|
"learning_rate": 8.620689655172412e-07,
|
|
"num_tokens": 338709.0,
|
|
"completions/mean_length": 145.0,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 213.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 145.0,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 213.0,
|
|
"tools/call_frequency": 3.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008833810687065125,
|
|
"sampling/sampling_logp_difference/max": 0.16674041748046875,
|
|
"sampling/importance_sampling_ratio/min": 0.0,
|
|
"sampling/importance_sampling_ratio/mean": 0.8426108360290527,
|
|
"sampling/importance_sampling_ratio/max": 1.2174991369247437,
|
|
"entropy": 0.3227213490754366,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.482032455503941,
|
|
"epoch": 0.001328125,
|
|
"step": 51
|
|
},
|
|
{
|
|
"loss": 0.3188627064228058,
|
|
"grad_norm": 7.887113571166992,
|
|
"learning_rate": 8.586206896551725e-07,
|
|
"num_tokens": 345148.0,
|
|
"completions/mean_length": 118.5,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 245.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 118.5,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 245.0,
|
|
"tools/call_frequency": 2.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.00836735125631094,
|
|
"sampling/sampling_logp_difference/max": 0.5611782073974609,
|
|
"sampling/importance_sampling_ratio/min": 0.5012302994728088,
|
|
"sampling/importance_sampling_ratio/mean": 0.9718648195266724,
|
|
"sampling/importance_sampling_ratio/max": 1.4218385219573975,
|
|
"entropy": 0.2617574315518141,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.429679621011019,
|
|
"epoch": 0.0013541666666666667,
|
|
"step": 52
|
|
},
|
|
{
|
|
"loss": 0.01578430086374283,
|
|
"grad_norm": 5.9074907302856445,
|
|
"learning_rate": 8.551724137931035e-07,
|
|
"num_tokens": 351570.0,
|
|
"completions/mean_length": 116.375,
|
|
"completions/min_length": 66.0,
|
|
"completions/max_length": 204.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 116.375,
|
|
"completions/min_terminated_length": 66.0,
|
|
"completions/max_terminated_length": 204.0,
|
|
"tools/call_frequency": 2.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009270556271076202,
|
|
"sampling/sampling_logp_difference/max": 0.22868609428405762,
|
|
"sampling/importance_sampling_ratio/min": 0.0,
|
|
"sampling/importance_sampling_ratio/mean": 0.7753545045852661,
|
|
"sampling/importance_sampling_ratio/max": 1.0618292093276978,
|
|
"entropy": 0.2742783650755882,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.451155975461006,
|
|
"epoch": 0.0013802083333333333,
|
|
"step": 53
|
|
},
|
|
{
|
|
"loss": 0.2927618622779846,
|
|
"grad_norm": 5.427998065948486,
|
|
"learning_rate": 8.517241379310345e-07,
|
|
"num_tokens": 358062.0,
|
|
"completions/mean_length": 124.875,
|
|
"completions/min_length": 66.0,
|
|
"completions/max_length": 194.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 124.875,
|
|
"completions/min_terminated_length": 66.0,
|
|
"completions/max_terminated_length": 194.0,
|
|
"tools/call_frequency": 3.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03125,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.03125,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.0062236059457063675,
|
|
"sampling/sampling_logp_difference/max": 0.194604754447937,
|
|
"sampling/importance_sampling_ratio/min": 0.6389504075050354,
|
|
"sampling/importance_sampling_ratio/mean": 1.0062472820281982,
|
|
"sampling/importance_sampling_ratio/max": 1.3035187721252441,
|
|
"entropy": 0.24960640631616116,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.2454654313623905,
|
|
"epoch": 0.00140625,
|
|
"step": 54
|
|
},
|
|
{
|
|
"loss": 0.2581663131713867,
|
|
"grad_norm": 5.975019454956055,
|
|
"learning_rate": 8.482758620689655e-07,
|
|
"num_tokens": 364799.0,
|
|
"completions/mean_length": 156.0,
|
|
"completions/min_length": 95.0,
|
|
"completions/max_length": 198.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 156.0,
|
|
"completions/min_terminated_length": 95.0,
|
|
"completions/max_terminated_length": 198.0,
|
|
"tools/call_frequency": 4.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008163003250956535,
|
|
"sampling/sampling_logp_difference/max": 0.6210435628890991,
|
|
"sampling/importance_sampling_ratio/min": 0.6495955586433411,
|
|
"sampling/importance_sampling_ratio/mean": 0.953213095664978,
|
|
"sampling/importance_sampling_ratio/max": 1.4132004976272583,
|
|
"entropy": 0.2986908555030823,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.385646548122168,
|
|
"epoch": 0.0014322916666666666,
|
|
"step": 55
|
|
},
|
|
{
|
|
"loss": 0.2269374132156372,
|
|
"grad_norm": 8.06528091430664,
|
|
"learning_rate": 8.448275862068965e-07,
|
|
"num_tokens": 371400.0,
|
|
"completions/mean_length": 139.5,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 207.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 139.5,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 207.0,
|
|
"tools/call_frequency": 3.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009682541713118553,
|
|
"sampling/sampling_logp_difference/max": 0.24823331832885742,
|
|
"sampling/importance_sampling_ratio/min": 0.5804888010025024,
|
|
"sampling/importance_sampling_ratio/mean": 0.9588527679443359,
|
|
"sampling/importance_sampling_ratio/max": 1.7588474750518799,
|
|
"entropy": 0.33883928693830967,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.46031716093421,
|
|
"epoch": 0.0014583333333333334,
|
|
"step": 56
|
|
},
|
|
{
|
|
"loss": 0.4875653386116028,
|
|
"grad_norm": 8.86308765411377,
|
|
"learning_rate": 8.413793103448276e-07,
|
|
"num_tokens": 378029.0,
|
|
"completions/mean_length": 142.25,
|
|
"completions/min_length": 61.0,
|
|
"completions/max_length": 211.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 142.25,
|
|
"completions/min_terminated_length": 61.0,
|
|
"completions/max_terminated_length": 211.0,
|
|
"tools/call_frequency": 3.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.00951333250850439,
|
|
"sampling/sampling_logp_difference/max": 0.2538604736328125,
|
|
"sampling/importance_sampling_ratio/min": 0.7266653180122375,
|
|
"sampling/importance_sampling_ratio/mean": 1.09211266040802,
|
|
"sampling/importance_sampling_ratio/max": 2.018314838409424,
|
|
"entropy": 0.29050587117671967,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.540868993848562,
|
|
"epoch": 0.001484375,
|
|
"step": 57
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 8.379310344827586e-07,
|
|
"num_tokens": 384926.0,
|
|
"completions/mean_length": 176.375,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 203.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 176.375,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 203.0,
|
|
"tools/call_frequency": 4.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.019999999552965164,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.019999999552965164,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008876016363501549,
|
|
"sampling/sampling_logp_difference/max": 0.2492060661315918,
|
|
"sampling/importance_sampling_ratio/min": 0.34912109375,
|
|
"sampling/importance_sampling_ratio/mean": 1.1389708518981934,
|
|
"sampling/importance_sampling_ratio/max": 1.7648930549621582,
|
|
"entropy": 0.3012118451297283,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.786813877522945,
|
|
"epoch": 0.0015104166666666666,
|
|
"step": 58
|
|
},
|
|
{
|
|
"loss": 0.43448126316070557,
|
|
"grad_norm": 7.258548736572266,
|
|
"learning_rate": 8.344827586206896e-07,
|
|
"num_tokens": 391685.0,
|
|
"completions/mean_length": 159.25,
|
|
"completions/min_length": 65.0,
|
|
"completions/max_length": 268.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 159.25,
|
|
"completions/min_terminated_length": 65.0,
|
|
"completions/max_terminated_length": 268.0,
|
|
"tools/call_frequency": 4.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008550588972866535,
|
|
"sampling/sampling_logp_difference/max": 0.30316686630249023,
|
|
"sampling/importance_sampling_ratio/min": 0.6319384574890137,
|
|
"sampling/importance_sampling_ratio/mean": 1.0341280698776245,
|
|
"sampling/importance_sampling_ratio/max": 1.453060269355774,
|
|
"entropy": 0.2590454611927271,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.722654994577169,
|
|
"epoch": 0.0015364583333333333,
|
|
"step": 59
|
|
},
|
|
{
|
|
"loss": 0.4190652072429657,
|
|
"grad_norm": 5.93164587020874,
|
|
"learning_rate": 8.310344827586206e-07,
|
|
"num_tokens": 398536.0,
|
|
"completions/mean_length": 171.0,
|
|
"completions/min_length": 94.0,
|
|
"completions/max_length": 220.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 171.0,
|
|
"completions/min_terminated_length": 94.0,
|
|
"completions/max_terminated_length": 220.0,
|
|
"tools/call_frequency": 4.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03125,
|
|
"rewards/reward_func/std": 0.015526474453508854,
|
|
"reward": 0.03125,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008862054906785488,
|
|
"sampling/sampling_logp_difference/max": 0.3719472885131836,
|
|
"sampling/importance_sampling_ratio/min": 0.5541459321975708,
|
|
"sampling/importance_sampling_ratio/mean": 1.0519256591796875,
|
|
"sampling/importance_sampling_ratio/max": 2.1038596630096436,
|
|
"entropy": 0.2931892015039921,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.494029957801104,
|
|
"epoch": 0.0015625,
|
|
"step": 60
|
|
},
|
|
{
|
|
"loss": 0.15857936441898346,
|
|
"grad_norm": 8.685916900634766,
|
|
"learning_rate": 8.275862068965517e-07,
|
|
"num_tokens": 405044.0,
|
|
"completions/mean_length": 127.375,
|
|
"completions/min_length": 70.0,
|
|
"completions/max_length": 197.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 127.375,
|
|
"completions/min_terminated_length": 70.0,
|
|
"completions/max_terminated_length": 197.0,
|
|
"tools/call_frequency": 3.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.007522088009864092,
|
|
"sampling/sampling_logp_difference/max": 0.3648815155029297,
|
|
"sampling/importance_sampling_ratio/min": 0.6608204245567322,
|
|
"sampling/importance_sampling_ratio/mean": 1.0251034498214722,
|
|
"sampling/importance_sampling_ratio/max": 1.4037553071975708,
|
|
"entropy": 0.27771896682679653,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.440516646951437,
|
|
"epoch": 0.0015885416666666667,
|
|
"step": 61
|
|
},
|
|
{
|
|
"loss": 0.32254666090011597,
|
|
"grad_norm": 5.963048458099365,
|
|
"learning_rate": 8.241379310344827e-07,
|
|
"num_tokens": 411641.0,
|
|
"completions/mean_length": 138.375,
|
|
"completions/min_length": 66.0,
|
|
"completions/max_length": 210.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 138.375,
|
|
"completions/min_terminated_length": 66.0,
|
|
"completions/max_terminated_length": 210.0,
|
|
"tools/call_frequency": 3.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.007839164696633816,
|
|
"sampling/sampling_logp_difference/max": 0.23007869720458984,
|
|
"sampling/importance_sampling_ratio/min": 0.6602538824081421,
|
|
"sampling/importance_sampling_ratio/mean": 0.9414231777191162,
|
|
"sampling/importance_sampling_ratio/max": 1.372970700263977,
|
|
"entropy": 0.2681508809328079,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.223766557872295,
|
|
"epoch": 0.0016145833333333333,
|
|
"step": 62
|
|
},
|
|
{
|
|
"loss": -0.11863896250724792,
|
|
"grad_norm": 6.0240607261657715,
|
|
"learning_rate": 8.206896551724138e-07,
|
|
"num_tokens": 418248.0,
|
|
"completions/mean_length": 138.75,
|
|
"completions/min_length": 63.0,
|
|
"completions/max_length": 241.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 138.75,
|
|
"completions/min_terminated_length": 63.0,
|
|
"completions/max_terminated_length": 241.0,
|
|
"tools/call_frequency": 3.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01045276876538992,
|
|
"sampling/sampling_logp_difference/max": 0.5996453762054443,
|
|
"sampling/importance_sampling_ratio/min": 0.5518931150436401,
|
|
"sampling/importance_sampling_ratio/mean": 0.9240298271179199,
|
|
"sampling/importance_sampling_ratio/max": 1.277245283126831,
|
|
"entropy": 0.27107655815780163,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.433187335729599,
|
|
"epoch": 0.001640625,
|
|
"step": 63
|
|
},
|
|
{
|
|
"loss": 0.13411760330200195,
|
|
"grad_norm": 5.554072856903076,
|
|
"learning_rate": 8.172413793103448e-07,
|
|
"num_tokens": 424651.0,
|
|
"completions/mean_length": 114.375,
|
|
"completions/min_length": 66.0,
|
|
"completions/max_length": 222.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 114.375,
|
|
"completions/min_terminated_length": 66.0,
|
|
"completions/max_terminated_length": 222.0,
|
|
"tools/call_frequency": 2.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.007139751687645912,
|
|
"sampling/sampling_logp_difference/max": 0.3027305006980896,
|
|
"sampling/importance_sampling_ratio/min": 0.6346269845962524,
|
|
"sampling/importance_sampling_ratio/mean": 0.91048663854599,
|
|
"sampling/importance_sampling_ratio/max": 1.3474019765853882,
|
|
"entropy": 0.2682610508054495,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.310452304780483,
|
|
"epoch": 0.0016666666666666668,
|
|
"step": 64
|
|
},
|
|
{
|
|
"loss": 0.05218823254108429,
|
|
"grad_norm": 6.961463928222656,
|
|
"learning_rate": 8.137931034482758e-07,
|
|
"num_tokens": 431413.0,
|
|
"completions/mean_length": 159.5,
|
|
"completions/min_length": 75.0,
|
|
"completions/max_length": 218.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 159.5,
|
|
"completions/min_terminated_length": 75.0,
|
|
"completions/max_terminated_length": 218.0,
|
|
"tools/call_frequency": 4.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03125,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.03125,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009722557850182056,
|
|
"sampling/sampling_logp_difference/max": 0.4775857925415039,
|
|
"sampling/importance_sampling_ratio/min": 0.489254891872406,
|
|
"sampling/importance_sampling_ratio/mean": 0.990435004234314,
|
|
"sampling/importance_sampling_ratio/max": 1.5411198139190674,
|
|
"entropy": 0.31989192217588425,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.8169816471636295,
|
|
"epoch": 0.0016927083333333334,
|
|
"step": 65
|
|
},
|
|
{
|
|
"loss": 0.1483156681060791,
|
|
"grad_norm": 5.2921600341796875,
|
|
"learning_rate": 8.103448275862068e-07,
|
|
"num_tokens": 438101.0,
|
|
"completions/mean_length": 149.875,
|
|
"completions/min_length": 100.0,
|
|
"completions/max_length": 197.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 149.875,
|
|
"completions/min_terminated_length": 100.0,
|
|
"completions/max_terminated_length": 197.0,
|
|
"tools/call_frequency": 3.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008863834664225578,
|
|
"sampling/sampling_logp_difference/max": 0.23262500762939453,
|
|
"sampling/importance_sampling_ratio/min": 0.7470085024833679,
|
|
"sampling/importance_sampling_ratio/mean": 1.033771276473999,
|
|
"sampling/importance_sampling_ratio/max": 1.3561131954193115,
|
|
"entropy": 0.3145777303725481,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.523774567991495,
|
|
"epoch": 0.00171875,
|
|
"step": 66
|
|
},
|
|
{
|
|
"loss": 0.49514874815940857,
|
|
"grad_norm": 9.326838493347168,
|
|
"learning_rate": 8.068965517241378e-07,
|
|
"num_tokens": 444648.0,
|
|
"completions/mean_length": 133.5,
|
|
"completions/min_length": 65.0,
|
|
"completions/max_length": 207.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 133.5,
|
|
"completions/min_terminated_length": 65.0,
|
|
"completions/max_terminated_length": 207.0,
|
|
"tools/call_frequency": 3.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008789469487965107,
|
|
"sampling/sampling_logp_difference/max": 0.30263692140579224,
|
|
"sampling/importance_sampling_ratio/min": 0.6185657978057861,
|
|
"sampling/importance_sampling_ratio/mean": 0.9254890084266663,
|
|
"sampling/importance_sampling_ratio/max": 1.8509927988052368,
|
|
"entropy": 0.249217065051198,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.356932740658522,
|
|
"epoch": 0.0017447916666666666,
|
|
"step": 67
|
|
},
|
|
{
|
|
"loss": 0.0597718209028244,
|
|
"grad_norm": 5.220883846282959,
|
|
"learning_rate": 8.03448275862069e-07,
|
|
"num_tokens": 451296.0,
|
|
"completions/mean_length": 145.375,
|
|
"completions/min_length": 60.0,
|
|
"completions/max_length": 206.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 145.375,
|
|
"completions/min_terminated_length": 60.0,
|
|
"completions/max_terminated_length": 206.0,
|
|
"tools/call_frequency": 3.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.00736664142459631,
|
|
"sampling/sampling_logp_difference/max": 0.2861800193786621,
|
|
"sampling/importance_sampling_ratio/min": 0.5959981083869934,
|
|
"sampling/importance_sampling_ratio/mean": 0.8661595582962036,
|
|
"sampling/importance_sampling_ratio/max": 1.1282408237457275,
|
|
"entropy": 0.2769886516034603,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.352283425629139,
|
|
"epoch": 0.0017708333333333332,
|
|
"step": 68
|
|
},
|
|
{
|
|
"loss": 0.06623853743076324,
|
|
"grad_norm": 5.788069248199463,
|
|
"learning_rate": 8e-07,
|
|
"num_tokens": 458096.0,
|
|
"completions/mean_length": 164.0,
|
|
"completions/min_length": 106.0,
|
|
"completions/max_length": 208.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 164.0,
|
|
"completions/min_terminated_length": 106.0,
|
|
"completions/max_terminated_length": 208.0,
|
|
"tools/call_frequency": 4.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009317398071289062,
|
|
"sampling/sampling_logp_difference/max": 0.21917223930358887,
|
|
"sampling/importance_sampling_ratio/min": 0.611605167388916,
|
|
"sampling/importance_sampling_ratio/mean": 0.9942731857299805,
|
|
"sampling/importance_sampling_ratio/max": 1.3109467029571533,
|
|
"entropy": 0.311614690348506,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.737263236194849,
|
|
"epoch": 0.001796875,
|
|
"step": 69
|
|
},
|
|
{
|
|
"loss": 0.36793047189712524,
|
|
"grad_norm": 5.774531841278076,
|
|
"learning_rate": 7.965517241379311e-07,
|
|
"num_tokens": 464754.0,
|
|
"completions/mean_length": 146.5,
|
|
"completions/min_length": 65.0,
|
|
"completions/max_length": 190.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 146.5,
|
|
"completions/min_terminated_length": 65.0,
|
|
"completions/max_terminated_length": 190.0,
|
|
"tools/call_frequency": 4.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.007341146469116211,
|
|
"sampling/sampling_logp_difference/max": 0.24997520446777344,
|
|
"sampling/importance_sampling_ratio/min": 0.6762236952781677,
|
|
"sampling/importance_sampling_ratio/mean": 0.9699811339378357,
|
|
"sampling/importance_sampling_ratio/max": 1.3894898891448975,
|
|
"entropy": 0.2440620381385088,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.231471247971058,
|
|
"epoch": 0.0018229166666666667,
|
|
"step": 70
|
|
},
|
|
{
|
|
"loss": 0.1511472910642624,
|
|
"grad_norm": 8.596271514892578,
|
|
"learning_rate": 7.931034482758621e-07,
|
|
"num_tokens": 471250.0,
|
|
"completions/mean_length": 126.0,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 210.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 126.0,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 210.0,
|
|
"tools/call_frequency": 3.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008768534287810326,
|
|
"sampling/sampling_logp_difference/max": 0.29262351989746094,
|
|
"sampling/importance_sampling_ratio/min": 0.4767390787601471,
|
|
"sampling/importance_sampling_ratio/mean": 1.0032906532287598,
|
|
"sampling/importance_sampling_ratio/max": 1.9425359964370728,
|
|
"entropy": 0.2569956723600626,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.341728907078505,
|
|
"epoch": 0.0018489583333333333,
|
|
"step": 71
|
|
},
|
|
{
|
|
"loss": 0.38776475191116333,
|
|
"grad_norm": 8.212038040161133,
|
|
"learning_rate": 7.896551724137931e-07,
|
|
"num_tokens": 477871.0,
|
|
"completions/mean_length": 142.125,
|
|
"completions/min_length": 79.0,
|
|
"completions/max_length": 207.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 142.125,
|
|
"completions/min_terminated_length": 79.0,
|
|
"completions/max_terminated_length": 207.0,
|
|
"tools/call_frequency": 3.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.007148672826588154,
|
|
"sampling/sampling_logp_difference/max": 0.3373904228210449,
|
|
"sampling/importance_sampling_ratio/min": 0.40989330410957336,
|
|
"sampling/importance_sampling_ratio/mean": 0.9974186420440674,
|
|
"sampling/importance_sampling_ratio/max": 1.454021692276001,
|
|
"entropy": 0.2415281105786562,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.433367874473333,
|
|
"epoch": 0.001875,
|
|
"step": 72
|
|
},
|
|
{
|
|
"loss": 0.06242813169956207,
|
|
"grad_norm": 5.431676387786865,
|
|
"learning_rate": 7.862068965517241e-07,
|
|
"num_tokens": 484612.0,
|
|
"completions/mean_length": 156.875,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 204.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 156.875,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 204.0,
|
|
"tools/call_frequency": 4.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008229869417846203,
|
|
"sampling/sampling_logp_difference/max": 0.2365880012512207,
|
|
"sampling/importance_sampling_ratio/min": 0.5166167616844177,
|
|
"sampling/importance_sampling_ratio/mean": 0.9250579476356506,
|
|
"sampling/importance_sampling_ratio/max": 1.69414484500885,
|
|
"entropy": 0.25781176798045635,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.521351788192987,
|
|
"epoch": 0.0019010416666666668,
|
|
"step": 73
|
|
},
|
|
{
|
|
"loss": 0.5322186946868896,
|
|
"grad_norm": 10.943680763244629,
|
|
"learning_rate": 7.827586206896552e-07,
|
|
"num_tokens": 491122.0,
|
|
"completions/mean_length": 128.0,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 212.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 128.0,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 212.0,
|
|
"tools/call_frequency": 3.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.007571771740913391,
|
|
"sampling/sampling_logp_difference/max": 0.2457261085510254,
|
|
"sampling/importance_sampling_ratio/min": 0.9035890102386475,
|
|
"sampling/importance_sampling_ratio/mean": 1.2514183521270752,
|
|
"sampling/importance_sampling_ratio/max": 1.9857929944992065,
|
|
"entropy": 0.23851043544709682,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.459375135600567,
|
|
"epoch": 0.0019270833333333334,
|
|
"step": 74
|
|
},
|
|
{
|
|
"loss": 0.46099984645843506,
|
|
"grad_norm": 8.244654655456543,
|
|
"learning_rate": 7.793103448275862e-07,
|
|
"num_tokens": 497745.0,
|
|
"completions/mean_length": 141.625,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 220.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 141.625,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 220.0,
|
|
"tools/call_frequency": 3.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008362981490790844,
|
|
"sampling/sampling_logp_difference/max": 0.2385869026184082,
|
|
"sampling/importance_sampling_ratio/min": 0.6858067512512207,
|
|
"sampling/importance_sampling_ratio/mean": 0.920607328414917,
|
|
"sampling/importance_sampling_ratio/max": 1.2481027841567993,
|
|
"entropy": 0.27047605998814106,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.52291614562273,
|
|
"epoch": 0.001953125,
|
|
"step": 75
|
|
},
|
|
{
|
|
"loss": 0.09317575395107269,
|
|
"grad_norm": 8.134749412536621,
|
|
"learning_rate": 7.758620689655172e-07,
|
|
"num_tokens": 504029.0,
|
|
"completions/mean_length": 99.125,
|
|
"completions/min_length": 65.0,
|
|
"completions/max_length": 189.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 99.125,
|
|
"completions/min_terminated_length": 65.0,
|
|
"completions/max_terminated_length": 189.0,
|
|
"tools/call_frequency": 2.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008144235238432884,
|
|
"sampling/sampling_logp_difference/max": 0.24631929397583008,
|
|
"sampling/importance_sampling_ratio/min": 0.5056509971618652,
|
|
"sampling/importance_sampling_ratio/mean": 0.8456082344055176,
|
|
"sampling/importance_sampling_ratio/max": 1.098840594291687,
|
|
"entropy": 0.218337994068861,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.183943759649992,
|
|
"epoch": 0.001979166666666667,
|
|
"step": 76
|
|
},
|
|
{
|
|
"loss": 0.570663332939148,
|
|
"grad_norm": 8.915884971618652,
|
|
"learning_rate": 7.724137931034482e-07,
|
|
"num_tokens": 510678.0,
|
|
"completions/mean_length": 145.125,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 232.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 145.125,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 232.0,
|
|
"tools/call_frequency": 3.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010542435571551323,
|
|
"sampling/sampling_logp_difference/max": 0.22301673889160156,
|
|
"sampling/importance_sampling_ratio/min": 0.392640084028244,
|
|
"sampling/importance_sampling_ratio/mean": 1.2197747230529785,
|
|
"sampling/importance_sampling_ratio/max": 2.2301859855651855,
|
|
"entropy": 0.32936161383986473,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.636154614388943,
|
|
"epoch": 0.0020052083333333332,
|
|
"step": 77
|
|
},
|
|
{
|
|
"loss": 0.13454610109329224,
|
|
"grad_norm": 6.01003360748291,
|
|
"learning_rate": 7.689655172413792e-07,
|
|
"num_tokens": 517154.0,
|
|
"completions/mean_length": 123.375,
|
|
"completions/min_length": 66.0,
|
|
"completions/max_length": 199.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 123.375,
|
|
"completions/min_terminated_length": 66.0,
|
|
"completions/max_terminated_length": 199.0,
|
|
"tools/call_frequency": 3.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010016914457082748,
|
|
"sampling/sampling_logp_difference/max": 0.4396820068359375,
|
|
"sampling/importance_sampling_ratio/min": 0.47836941480636597,
|
|
"sampling/importance_sampling_ratio/mean": 1.0448076725006104,
|
|
"sampling/importance_sampling_ratio/max": 1.7316462993621826,
|
|
"entropy": 0.2553398059681058,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.166990853846073,
|
|
"epoch": 0.00203125,
|
|
"step": 78
|
|
},
|
|
{
|
|
"loss": 0.2500889301300049,
|
|
"grad_norm": 5.0226216316223145,
|
|
"learning_rate": 7.655172413793102e-07,
|
|
"num_tokens": 524019.0,
|
|
"completions/mean_length": 172.875,
|
|
"completions/min_length": 118.0,
|
|
"completions/max_length": 216.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 172.875,
|
|
"completions/min_terminated_length": 118.0,
|
|
"completions/max_terminated_length": 216.0,
|
|
"tools/call_frequency": 4.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008261576294898987,
|
|
"sampling/sampling_logp_difference/max": 0.3001713752746582,
|
|
"sampling/importance_sampling_ratio/min": 0.5074343681335449,
|
|
"sampling/importance_sampling_ratio/mean": 0.876280665397644,
|
|
"sampling/importance_sampling_ratio/max": 1.602623462677002,
|
|
"entropy": 0.29555561020970345,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.524432118982077,
|
|
"epoch": 0.0020572916666666665,
|
|
"step": 79
|
|
},
|
|
{
|
|
"loss": 0.6009180545806885,
|
|
"grad_norm": 8.971160888671875,
|
|
"learning_rate": 7.620689655172414e-07,
|
|
"num_tokens": 530438.0,
|
|
"completions/mean_length": 116.5,
|
|
"completions/min_length": 63.0,
|
|
"completions/max_length": 204.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 116.5,
|
|
"completions/min_terminated_length": 63.0,
|
|
"completions/max_terminated_length": 204.0,
|
|
"tools/call_frequency": 2.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008285257034003735,
|
|
"sampling/sampling_logp_difference/max": 0.2853531837463379,
|
|
"sampling/importance_sampling_ratio/min": 0.7052885890007019,
|
|
"sampling/importance_sampling_ratio/mean": 1.0779139995574951,
|
|
"sampling/importance_sampling_ratio/max": 1.542609453201294,
|
|
"entropy": 0.25474693067371845,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.504926174879074,
|
|
"epoch": 0.0020833333333333333,
|
|
"step": 80
|
|
},
|
|
{
|
|
"loss": 0.2352580726146698,
|
|
"grad_norm": 6.356550216674805,
|
|
"learning_rate": 7.586206896551724e-07,
|
|
"num_tokens": 537036.0,
|
|
"completions/mean_length": 138.0,
|
|
"completions/min_length": 66.0,
|
|
"completions/max_length": 212.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 138.0,
|
|
"completions/min_terminated_length": 66.0,
|
|
"completions/max_terminated_length": 212.0,
|
|
"tools/call_frequency": 3.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526474453508854,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.007834731601178646,
|
|
"sampling/sampling_logp_difference/max": 0.2130584716796875,
|
|
"sampling/importance_sampling_ratio/min": 0.8550736308097839,
|
|
"sampling/importance_sampling_ratio/mean": 1.0940049886703491,
|
|
"sampling/importance_sampling_ratio/max": 1.4123036861419678,
|
|
"entropy": 0.29896221682429314,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.5186101868748665,
|
|
"epoch": 0.002109375,
|
|
"step": 81
|
|
},
|
|
{
|
|
"loss": 0.2918560206890106,
|
|
"grad_norm": 5.458775520324707,
|
|
"learning_rate": 7.551724137931034e-07,
|
|
"num_tokens": 543973.0,
|
|
"completions/mean_length": 181.25,
|
|
"completions/min_length": 83.0,
|
|
"completions/max_length": 258.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 181.25,
|
|
"completions/min_terminated_length": 83.0,
|
|
"completions/max_terminated_length": 258.0,
|
|
"tools/call_frequency": 4.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03125,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.03125,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.0094722555950284,
|
|
"sampling/sampling_logp_difference/max": 0.30549657344818115,
|
|
"sampling/importance_sampling_ratio/min": 0.4431401789188385,
|
|
"sampling/importance_sampling_ratio/mean": 1.0626211166381836,
|
|
"sampling/importance_sampling_ratio/max": 1.974442958831787,
|
|
"entropy": 0.3471503220498562,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.858669966459274,
|
|
"epoch": 0.0021354166666666665,
|
|
"step": 82
|
|
},
|
|
{
|
|
"loss": -0.05157988891005516,
|
|
"grad_norm": 6.189342021942139,
|
|
"learning_rate": 7.517241379310344e-07,
|
|
"num_tokens": 550616.0,
|
|
"completions/mean_length": 145.0,
|
|
"completions/min_length": 63.0,
|
|
"completions/max_length": 220.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 145.0,
|
|
"completions/min_terminated_length": 63.0,
|
|
"completions/max_terminated_length": 220.0,
|
|
"tools/call_frequency": 3.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009663700126111507,
|
|
"sampling/sampling_logp_difference/max": 0.3085569143295288,
|
|
"sampling/importance_sampling_ratio/min": 0.0,
|
|
"sampling/importance_sampling_ratio/mean": 0.9613282084465027,
|
|
"sampling/importance_sampling_ratio/max": 1.4465934038162231,
|
|
"entropy": 0.284167492762208,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.456232123076916,
|
|
"epoch": 0.0021614583333333334,
|
|
"step": 83
|
|
},
|
|
{
|
|
"loss": 0.21563875675201416,
|
|
"grad_norm": 6.461734771728516,
|
|
"learning_rate": 7.482758620689655e-07,
|
|
"num_tokens": 557107.0,
|
|
"completions/mean_length": 126.375,
|
|
"completions/min_length": 66.0,
|
|
"completions/max_length": 238.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 126.375,
|
|
"completions/min_terminated_length": 66.0,
|
|
"completions/max_terminated_length": 238.0,
|
|
"tools/call_frequency": 3.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008060681633651257,
|
|
"sampling/sampling_logp_difference/max": 0.25173044204711914,
|
|
"sampling/importance_sampling_ratio/min": 0.47610586881637573,
|
|
"sampling/importance_sampling_ratio/mean": 0.8433263897895813,
|
|
"sampling/importance_sampling_ratio/max": 1.2606743574142456,
|
|
"entropy": 0.24939616210758686,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.385654982179403,
|
|
"epoch": 0.0021875,
|
|
"step": 84
|
|
},
|
|
{
|
|
"loss": 0.6945865154266357,
|
|
"grad_norm": 8.50930404663086,
|
|
"learning_rate": 7.448275862068965e-07,
|
|
"num_tokens": 563826.0,
|
|
"completions/mean_length": 154.0,
|
|
"completions/min_length": 65.0,
|
|
"completions/max_length": 220.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 154.0,
|
|
"completions/min_terminated_length": 65.0,
|
|
"completions/max_terminated_length": 220.0,
|
|
"tools/call_frequency": 4.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03125,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.03125,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009406828321516514,
|
|
"sampling/sampling_logp_difference/max": 0.21660232543945312,
|
|
"sampling/importance_sampling_ratio/min": 0.5684511661529541,
|
|
"sampling/importance_sampling_ratio/mean": 1.337892770767212,
|
|
"sampling/importance_sampling_ratio/max": 2.909498929977417,
|
|
"entropy": 0.3046402707695961,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.353375978767872,
|
|
"epoch": 0.0022135416666666666,
|
|
"step": 85
|
|
},
|
|
{
|
|
"loss": -0.06191016733646393,
|
|
"grad_norm": 5.368035316467285,
|
|
"learning_rate": 7.413793103448276e-07,
|
|
"num_tokens": 570733.0,
|
|
"completions/mean_length": 177.25,
|
|
"completions/min_length": 115.0,
|
|
"completions/max_length": 215.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 177.25,
|
|
"completions/min_terminated_length": 115.0,
|
|
"completions/max_terminated_length": 215.0,
|
|
"tools/call_frequency": 5.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.027499999850988388,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.027499999850988388,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.007655786350369453,
|
|
"sampling/sampling_logp_difference/max": 0.2167069911956787,
|
|
"sampling/importance_sampling_ratio/min": 0.7241263389587402,
|
|
"sampling/importance_sampling_ratio/mean": 0.9419474601745605,
|
|
"sampling/importance_sampling_ratio/max": 1.1550995111465454,
|
|
"entropy": 0.2920949477702379,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.499181512743235,
|
|
"epoch": 0.0022395833333333334,
|
|
"step": 86
|
|
},
|
|
{
|
|
"loss": 0.8515288829803467,
|
|
"grad_norm": 17.70108413696289,
|
|
"learning_rate": 7.379310344827586e-07,
|
|
"num_tokens": 577255.0,
|
|
"completions/mean_length": 129.125,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 224.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 129.125,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 224.0,
|
|
"tools/call_frequency": 3.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.007969329133629799,
|
|
"sampling/sampling_logp_difference/max": 0.24946022033691406,
|
|
"sampling/importance_sampling_ratio/min": 0.7997300028800964,
|
|
"sampling/importance_sampling_ratio/mean": 1.3395278453826904,
|
|
"sampling/importance_sampling_ratio/max": 2.239732503890991,
|
|
"entropy": 0.2848993130028248,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.399962909519672,
|
|
"epoch": 0.002265625,
|
|
"step": 87
|
|
},
|
|
{
|
|
"loss": 0.25452882051467896,
|
|
"grad_norm": 6.64228630065918,
|
|
"learning_rate": 7.344827586206897e-07,
|
|
"num_tokens": 584148.0,
|
|
"completions/mean_length": 175.5,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 263.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 175.5,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 263.0,
|
|
"tools/call_frequency": 4.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03125,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.03125,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009299642406404018,
|
|
"sampling/sampling_logp_difference/max": 0.38968801498413086,
|
|
"sampling/importance_sampling_ratio/min": 0.6392223834991455,
|
|
"sampling/importance_sampling_ratio/mean": 1.0492146015167236,
|
|
"sampling/importance_sampling_ratio/max": 1.52628755569458,
|
|
"entropy": 0.3547398392111063,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.728387854993343,
|
|
"epoch": 0.0022916666666666667,
|
|
"step": 88
|
|
},
|
|
{
|
|
"loss": 0.1478448212146759,
|
|
"grad_norm": 6.071128845214844,
|
|
"learning_rate": 7.310344827586207e-07,
|
|
"num_tokens": 590640.0,
|
|
"completions/mean_length": 126.0,
|
|
"completions/min_length": 66.0,
|
|
"completions/max_length": 208.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 126.0,
|
|
"completions/min_terminated_length": 66.0,
|
|
"completions/max_terminated_length": 208.0,
|
|
"tools/call_frequency": 3.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008932434022426605,
|
|
"sampling/sampling_logp_difference/max": 0.2498931884765625,
|
|
"sampling/importance_sampling_ratio/min": 0.5249428153038025,
|
|
"sampling/importance_sampling_ratio/mean": 0.9446492195129395,
|
|
"sampling/importance_sampling_ratio/max": 1.2786856889724731,
|
|
"entropy": 0.253721933811903,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.359964806586504,
|
|
"epoch": 0.0023177083333333335,
|
|
"step": 89
|
|
},
|
|
{
|
|
"loss": 0.3898836076259613,
|
|
"grad_norm": 3.808424234390259,
|
|
"learning_rate": 7.275862068965517e-07,
|
|
"num_tokens": 597435.0,
|
|
"completions/mean_length": 164.125,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 227.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 164.125,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 227.0,
|
|
"tools/call_frequency": 4.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03125,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.03125,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.007341077085584402,
|
|
"sampling/sampling_logp_difference/max": 0.24884438514709473,
|
|
"sampling/importance_sampling_ratio/min": 0.5126860737800598,
|
|
"sampling/importance_sampling_ratio/mean": 0.8337280750274658,
|
|
"sampling/importance_sampling_ratio/max": 1.5602962970733643,
|
|
"entropy": 0.2886700499802828,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.560893692076206,
|
|
"epoch": 0.00234375,
|
|
"step": 90
|
|
},
|
|
{
|
|
"loss": 0.08567449450492859,
|
|
"grad_norm": 7.263461589813232,
|
|
"learning_rate": 7.241379310344827e-07,
|
|
"num_tokens": 604204.0,
|
|
"completions/mean_length": 160.25,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 220.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 160.25,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 220.0,
|
|
"tools/call_frequency": 4.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010189800523221493,
|
|
"sampling/sampling_logp_difference/max": 0.2825280427932739,
|
|
"sampling/importance_sampling_ratio/min": 0.6635783314704895,
|
|
"sampling/importance_sampling_ratio/mean": 1.100722312927246,
|
|
"sampling/importance_sampling_ratio/max": 1.9450410604476929,
|
|
"entropy": 0.3187738787382841,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.511255070567131,
|
|
"epoch": 0.0023697916666666667,
|
|
"step": 91
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 7.206896551724138e-07,
|
|
"num_tokens": 611405.0,
|
|
"completions/mean_length": 214.375,
|
|
"completions/min_length": 195.0,
|
|
"completions/max_length": 240.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 214.375,
|
|
"completions/min_terminated_length": 195.0,
|
|
"completions/max_terminated_length": 240.0,
|
|
"tools/call_frequency": 6.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.019999999552965164,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.019999999552965164,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010789207182824612,
|
|
"sampling/sampling_logp_difference/max": 0.4990198612213135,
|
|
"sampling/importance_sampling_ratio/min": 0.5940403342247009,
|
|
"sampling/importance_sampling_ratio/mean": 0.9162781834602356,
|
|
"sampling/importance_sampling_ratio/max": 1.4239654541015625,
|
|
"entropy": 0.4032662734389305,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.9268285520374775,
|
|
"epoch": 0.002395833333333333,
|
|
"step": 92
|
|
},
|
|
{
|
|
"loss": 0.13994011282920837,
|
|
"grad_norm": 6.414453029632568,
|
|
"learning_rate": 7.172413793103448e-07,
|
|
"num_tokens": 617916.0,
|
|
"completions/mean_length": 127.75,
|
|
"completions/min_length": 62.0,
|
|
"completions/max_length": 234.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 127.75,
|
|
"completions/min_terminated_length": 62.0,
|
|
"completions/max_terminated_length": 234.0,
|
|
"tools/call_frequency": 2.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010887646116316319,
|
|
"sampling/sampling_logp_difference/max": 0.23942828178405762,
|
|
"sampling/importance_sampling_ratio/min": 0.6223735213279724,
|
|
"sampling/importance_sampling_ratio/mean": 0.9778643846511841,
|
|
"sampling/importance_sampling_ratio/max": 1.4726736545562744,
|
|
"entropy": 0.36310600489377975,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.33135436847806,
|
|
"epoch": 0.002421875,
|
|
"step": 93
|
|
},
|
|
{
|
|
"loss": 0.1991899162530899,
|
|
"grad_norm": 8.0427885055542,
|
|
"learning_rate": 7.137931034482758e-07,
|
|
"num_tokens": 624325.0,
|
|
"completions/mean_length": 115.25,
|
|
"completions/min_length": 66.0,
|
|
"completions/max_length": 228.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 115.25,
|
|
"completions/min_terminated_length": 66.0,
|
|
"completions/max_terminated_length": 228.0,
|
|
"tools/call_frequency": 2.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010500107891857624,
|
|
"sampling/sampling_logp_difference/max": 0.24846124649047852,
|
|
"sampling/importance_sampling_ratio/min": 0.597498893737793,
|
|
"sampling/importance_sampling_ratio/mean": 0.9912357330322266,
|
|
"sampling/importance_sampling_ratio/max": 1.8281104564666748,
|
|
"entropy": 0.2825307007879019,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.036309238523245,
|
|
"epoch": 0.002447916666666667,
|
|
"step": 94
|
|
},
|
|
{
|
|
"loss": 0.5406280755996704,
|
|
"grad_norm": 7.821378231048584,
|
|
"learning_rate": 7.103448275862068e-07,
|
|
"num_tokens": 631078.0,
|
|
"completions/mean_length": 158.75,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 231.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 158.75,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 231.0,
|
|
"tools/call_frequency": 3.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009617233648896217,
|
|
"sampling/sampling_logp_difference/max": 0.21808719635009766,
|
|
"sampling/importance_sampling_ratio/min": 0.8593995571136475,
|
|
"sampling/importance_sampling_ratio/mean": 1.1358684301376343,
|
|
"sampling/importance_sampling_ratio/max": 1.709311604499817,
|
|
"entropy": 0.3756424766033888,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.825226806104183,
|
|
"epoch": 0.0024739583333333332,
|
|
"step": 95
|
|
},
|
|
{
|
|
"loss": 0.53407883644104,
|
|
"grad_norm": 7.026584625244141,
|
|
"learning_rate": 7.068965517241378e-07,
|
|
"num_tokens": 637694.0,
|
|
"completions/mean_length": 140.75,
|
|
"completions/min_length": 70.0,
|
|
"completions/max_length": 263.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 140.75,
|
|
"completions/min_terminated_length": 70.0,
|
|
"completions/max_terminated_length": 263.0,
|
|
"tools/call_frequency": 3.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008432169444859028,
|
|
"sampling/sampling_logp_difference/max": 0.22923564910888672,
|
|
"sampling/importance_sampling_ratio/min": 0.5495845675468445,
|
|
"sampling/importance_sampling_ratio/mean": 1.0923351049423218,
|
|
"sampling/importance_sampling_ratio/max": 1.7565199136734009,
|
|
"entropy": 0.2904543075710535,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.567758847028017,
|
|
"epoch": 0.0025,
|
|
"step": 96
|
|
},
|
|
{
|
|
"loss": -0.000713050365447998,
|
|
"grad_norm": 6.309239387512207,
|
|
"learning_rate": 7.034482758620688e-07,
|
|
"num_tokens": 644119.0,
|
|
"completions/mean_length": 117.0,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 227.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 117.0,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 227.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008647211827337742,
|
|
"sampling/sampling_logp_difference/max": 0.4868502616882324,
|
|
"sampling/importance_sampling_ratio/min": 0.5282098054885864,
|
|
"sampling/importance_sampling_ratio/mean": 0.893794596195221,
|
|
"sampling/importance_sampling_ratio/max": 1.185192346572876,
|
|
"entropy": 0.28001012466847897,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.321182422339916,
|
|
"epoch": 0.0025260416666666665,
|
|
"step": 97
|
|
},
|
|
{
|
|
"loss": 0.23587137460708618,
|
|
"grad_norm": 6.945014953613281,
|
|
"learning_rate": 7e-07,
|
|
"num_tokens": 650813.0,
|
|
"completions/mean_length": 150.625,
|
|
"completions/min_length": 96.0,
|
|
"completions/max_length": 247.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 150.625,
|
|
"completions/min_terminated_length": 96.0,
|
|
"completions/max_terminated_length": 247.0,
|
|
"tools/call_frequency": 3.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008644724264740944,
|
|
"sampling/sampling_logp_difference/max": 0.2679615020751953,
|
|
"sampling/importance_sampling_ratio/min": 0.22528891265392303,
|
|
"sampling/importance_sampling_ratio/mean": 0.8298790454864502,
|
|
"sampling/importance_sampling_ratio/max": 1.3694086074829102,
|
|
"entropy": 0.28797223791480064,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.442151132971048,
|
|
"epoch": 0.0025520833333333333,
|
|
"step": 98
|
|
},
|
|
{
|
|
"loss": 0.2695174813270569,
|
|
"grad_norm": 8.812966346740723,
|
|
"learning_rate": 6.96551724137931e-07,
|
|
"num_tokens": 657238.0,
|
|
"completions/mean_length": 116.375,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 210.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 116.375,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 210.0,
|
|
"tools/call_frequency": 2.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008048093877732754,
|
|
"sampling/sampling_logp_difference/max": 0.20413684844970703,
|
|
"sampling/importance_sampling_ratio/min": 0.4447140097618103,
|
|
"sampling/importance_sampling_ratio/mean": 0.8850213289260864,
|
|
"sampling/importance_sampling_ratio/max": 1.1496365070343018,
|
|
"entropy": 0.25912114046514034,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.412706505507231,
|
|
"epoch": 0.002578125,
|
|
"step": 99
|
|
},
|
|
{
|
|
"loss": 0.29190051555633545,
|
|
"grad_norm": 11.16254711151123,
|
|
"learning_rate": 6.931034482758621e-07,
|
|
"num_tokens": 663548.0,
|
|
"completions/mean_length": 103.125,
|
|
"completions/min_length": 34.0,
|
|
"completions/max_length": 270.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 103.125,
|
|
"completions/min_terminated_length": 34.0,
|
|
"completions/max_terminated_length": 270.0,
|
|
"tools/call_frequency": 1.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03999999910593033,
|
|
"rewards/reward_func/std": 0.01927248388528824,
|
|
"reward": 0.03999999910593033,
|
|
"reward_std": 0.01927248202264309,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.00992105808109045,
|
|
"sampling/sampling_logp_difference/max": 0.24373388290405273,
|
|
"sampling/importance_sampling_ratio/min": 0.7359528541564941,
|
|
"sampling/importance_sampling_ratio/mean": 1.0251843929290771,
|
|
"sampling/importance_sampling_ratio/max": 1.4961566925048828,
|
|
"entropy": 0.28604586608707905,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.247550934553146,
|
|
"epoch": 0.0026041666666666665,
|
|
"step": 100
|
|
},
|
|
{
|
|
"loss": 0.24865862727165222,
|
|
"grad_norm": 5.261774063110352,
|
|
"learning_rate": 6.896551724137931e-07,
|
|
"num_tokens": 670343.0,
|
|
"completions/mean_length": 163.375,
|
|
"completions/min_length": 94.0,
|
|
"completions/max_length": 240.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 163.375,
|
|
"completions/min_terminated_length": 94.0,
|
|
"completions/max_terminated_length": 240.0,
|
|
"tools/call_frequency": 4.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009819349274039268,
|
|
"sampling/sampling_logp_difference/max": 0.36313843727111816,
|
|
"sampling/importance_sampling_ratio/min": 0.41267672181129456,
|
|
"sampling/importance_sampling_ratio/mean": 0.9107467532157898,
|
|
"sampling/importance_sampling_ratio/max": 1.6202714443206787,
|
|
"entropy": 0.335450554266572,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.4468593411147594,
|
|
"epoch": 0.0026302083333333334,
|
|
"step": 101
|
|
},
|
|
{
|
|
"loss": -0.0854048877954483,
|
|
"grad_norm": 3.224552631378174,
|
|
"learning_rate": 6.862068965517241e-07,
|
|
"num_tokens": 676892.0,
|
|
"completions/mean_length": 133.5,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 249.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 133.5,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 249.0,
|
|
"tools/call_frequency": 3.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.0092065604403615,
|
|
"sampling/sampling_logp_difference/max": 0.3598816394805908,
|
|
"sampling/importance_sampling_ratio/min": 0.28250178694725037,
|
|
"sampling/importance_sampling_ratio/mean": 0.8323373198509216,
|
|
"sampling/importance_sampling_ratio/max": 1.2101935148239136,
|
|
"entropy": 0.31629459373652935,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.2624360509216785,
|
|
"epoch": 0.00265625,
|
|
"step": 102
|
|
},
|
|
{
|
|
"loss": 0.18058490753173828,
|
|
"grad_norm": 6.811054229736328,
|
|
"learning_rate": 6.827586206896552e-07,
|
|
"num_tokens": 683130.0,
|
|
"completions/mean_length": 93.875,
|
|
"completions/min_length": 66.0,
|
|
"completions/max_length": 201.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 93.875,
|
|
"completions/min_terminated_length": 66.0,
|
|
"completions/max_terminated_length": 201.0,
|
|
"tools/call_frequency": 1.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.007291003596037626,
|
|
"sampling/sampling_logp_difference/max": 0.22459936141967773,
|
|
"sampling/importance_sampling_ratio/min": 0.5617707967758179,
|
|
"sampling/importance_sampling_ratio/mean": 0.9265198707580566,
|
|
"sampling/importance_sampling_ratio/max": 1.5528124570846558,
|
|
"entropy": 0.25530113093554974,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.358579859137535,
|
|
"epoch": 0.0026822916666666666,
|
|
"step": 103
|
|
},
|
|
{
|
|
"loss": 0.6638057231903076,
|
|
"grad_norm": 11.878508567810059,
|
|
"learning_rate": 6.793103448275862e-07,
|
|
"num_tokens": 689624.0,
|
|
"completions/mean_length": 126.0,
|
|
"completions/min_length": 63.0,
|
|
"completions/max_length": 239.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 126.0,
|
|
"completions/min_terminated_length": 63.0,
|
|
"completions/max_terminated_length": 239.0,
|
|
"tools/call_frequency": 3.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008976939134299755,
|
|
"sampling/sampling_logp_difference/max": 0.20221185684204102,
|
|
"sampling/importance_sampling_ratio/min": 0.6644434928894043,
|
|
"sampling/importance_sampling_ratio/mean": 1.0369466543197632,
|
|
"sampling/importance_sampling_ratio/max": 1.4996607303619385,
|
|
"entropy": 0.2792720487341285,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.436473652720451,
|
|
"epoch": 0.0027083333333333334,
|
|
"step": 104
|
|
},
|
|
{
|
|
"loss": 0.38534292578697205,
|
|
"grad_norm": 7.971909999847412,
|
|
"learning_rate": 6.758620689655172e-07,
|
|
"num_tokens": 696204.0,
|
|
"completions/mean_length": 136.125,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 236.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 136.125,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 236.0,
|
|
"tools/call_frequency": 3.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008056542836129665,
|
|
"sampling/sampling_logp_difference/max": 0.22664499282836914,
|
|
"sampling/importance_sampling_ratio/min": 0.4758111834526062,
|
|
"sampling/importance_sampling_ratio/mean": 0.9010859727859497,
|
|
"sampling/importance_sampling_ratio/max": 1.4847228527069092,
|
|
"entropy": 0.29511207714676857,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.513696450740099,
|
|
"epoch": 0.002734375,
|
|
"step": 105
|
|
},
|
|
{
|
|
"loss": 0.457573264837265,
|
|
"grad_norm": 12.70578670501709,
|
|
"learning_rate": 6.724137931034482e-07,
|
|
"num_tokens": 702845.0,
|
|
"completions/mean_length": 144.375,
|
|
"completions/min_length": 65.0,
|
|
"completions/max_length": 242.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 144.375,
|
|
"completions/min_terminated_length": 65.0,
|
|
"completions/max_terminated_length": 242.0,
|
|
"tools/call_frequency": 3.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009682387113571167,
|
|
"sampling/sampling_logp_difference/max": 0.29464268684387207,
|
|
"sampling/importance_sampling_ratio/min": 0.40440255403518677,
|
|
"sampling/importance_sampling_ratio/mean": 0.9459686279296875,
|
|
"sampling/importance_sampling_ratio/max": 1.7747485637664795,
|
|
"entropy": 0.33646082133054733,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.841759774833918,
|
|
"epoch": 0.0027604166666666667,
|
|
"step": 106
|
|
},
|
|
{
|
|
"loss": 0.04955286160111427,
|
|
"grad_norm": 4.8294219970703125,
|
|
"learning_rate": 6.689655172413793e-07,
|
|
"num_tokens": 709580.0,
|
|
"completions/mean_length": 156.5,
|
|
"completions/min_length": 65.0,
|
|
"completions/max_length": 240.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 156.5,
|
|
"completions/min_terminated_length": 65.0,
|
|
"completions/max_terminated_length": 240.0,
|
|
"tools/call_frequency": 3.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01016034372150898,
|
|
"sampling/sampling_logp_difference/max": 0.28028392791748047,
|
|
"sampling/importance_sampling_ratio/min": 0.42742687463760376,
|
|
"sampling/importance_sampling_ratio/mean": 0.8592504262924194,
|
|
"sampling/importance_sampling_ratio/max": 1.526597499847412,
|
|
"entropy": 0.3489740416407585,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.500570334494114,
|
|
"epoch": 0.0027864583333333335,
|
|
"step": 107
|
|
},
|
|
{
|
|
"loss": -0.029814463108778,
|
|
"grad_norm": 5.221089839935303,
|
|
"learning_rate": 6.655172413793103e-07,
|
|
"num_tokens": 715992.0,
|
|
"completions/mean_length": 116.375,
|
|
"completions/min_length": 28.0,
|
|
"completions/max_length": 222.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 116.375,
|
|
"completions/min_terminated_length": 28.0,
|
|
"completions/max_terminated_length": 222.0,
|
|
"tools/call_frequency": 2.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.036250002682209015,
|
|
"rewards/reward_func/std": 0.019955307245254517,
|
|
"reward": 0.036250002682209015,
|
|
"reward_std": 0.019955307245254517,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010254090651869774,
|
|
"sampling/sampling_logp_difference/max": 0.47780680656433105,
|
|
"sampling/importance_sampling_ratio/min": 0.4960949420928955,
|
|
"sampling/importance_sampling_ratio/mean": 0.821640133857727,
|
|
"sampling/importance_sampling_ratio/max": 1.0076278448104858,
|
|
"entropy": 0.3187275193631649,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.351175215095282,
|
|
"epoch": 0.0028125,
|
|
"step": 108
|
|
},
|
|
{
|
|
"loss": 0.14341574907302856,
|
|
"grad_norm": 8.162286758422852,
|
|
"learning_rate": 6.620689655172414e-07,
|
|
"num_tokens": 722540.0,
|
|
"completions/mean_length": 133.125,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 258.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 133.125,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 258.0,
|
|
"tools/call_frequency": 3.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008738499134778976,
|
|
"sampling/sampling_logp_difference/max": 0.20012903213500977,
|
|
"sampling/importance_sampling_ratio/min": 0.46840620040893555,
|
|
"sampling/importance_sampling_ratio/mean": 0.8534986972808838,
|
|
"sampling/importance_sampling_ratio/max": 1.053305983543396,
|
|
"entropy": 0.28179205395281315,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.393744621425867,
|
|
"epoch": 0.0028385416666666667,
|
|
"step": 109
|
|
},
|
|
{
|
|
"loss": 0.10319685935974121,
|
|
"grad_norm": 8.913573265075684,
|
|
"learning_rate": 6.586206896551724e-07,
|
|
"num_tokens": 729130.0,
|
|
"completions/mean_length": 137.875,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 243.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 137.875,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 243.0,
|
|
"tools/call_frequency": 3.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010171914473176003,
|
|
"sampling/sampling_logp_difference/max": 0.2502436637878418,
|
|
"sampling/importance_sampling_ratio/min": 0.6672365665435791,
|
|
"sampling/importance_sampling_ratio/mean": 1.1061110496520996,
|
|
"sampling/importance_sampling_ratio/max": 1.88072669506073,
|
|
"entropy": 0.32766908034682274,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.572240140289068,
|
|
"epoch": 0.002864583333333333,
|
|
"step": 110
|
|
},
|
|
{
|
|
"loss": 0.1610165536403656,
|
|
"grad_norm": 5.715359687805176,
|
|
"learning_rate": 6.551724137931034e-07,
|
|
"num_tokens": 735703.0,
|
|
"completions/mean_length": 134.875,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 221.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 134.875,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 221.0,
|
|
"tools/call_frequency": 3.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010177217423915863,
|
|
"sampling/sampling_logp_difference/max": 0.29056406021118164,
|
|
"sampling/importance_sampling_ratio/min": 0.6527516841888428,
|
|
"sampling/importance_sampling_ratio/mean": 0.9015135169029236,
|
|
"sampling/importance_sampling_ratio/max": 1.4877452850341797,
|
|
"entropy": 0.36283982545137405,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.478623580187559,
|
|
"epoch": 0.002890625,
|
|
"step": 111
|
|
},
|
|
{
|
|
"loss": 0.4657711386680603,
|
|
"grad_norm": 6.806517601013184,
|
|
"learning_rate": 6.517241379310344e-07,
|
|
"num_tokens": 742608.0,
|
|
"completions/mean_length": 178.0,
|
|
"completions/min_length": 82.0,
|
|
"completions/max_length": 236.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 178.0,
|
|
"completions/min_terminated_length": 82.0,
|
|
"completions/max_terminated_length": 236.0,
|
|
"tools/call_frequency": 4.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03125,
|
|
"rewards/reward_func/std": 0.015526474453508854,
|
|
"reward": 0.03125,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010571856983006,
|
|
"sampling/sampling_logp_difference/max": 0.2958518862724304,
|
|
"sampling/importance_sampling_ratio/min": 0.7404189705848694,
|
|
"sampling/importance_sampling_ratio/mean": 1.228243112564087,
|
|
"sampling/importance_sampling_ratio/max": 2.1055681705474854,
|
|
"entropy": 0.39382102340459824,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.539896458387375,
|
|
"epoch": 0.002916666666666667,
|
|
"step": 112
|
|
},
|
|
{
|
|
"loss": -0.002735935151576996,
|
|
"grad_norm": 6.4718427658081055,
|
|
"learning_rate": 6.482758620689654e-07,
|
|
"num_tokens": 749343.0,
|
|
"completions/mean_length": 155.5,
|
|
"completions/min_length": 72.0,
|
|
"completions/max_length": 213.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 155.5,
|
|
"completions/min_terminated_length": 72.0,
|
|
"completions/max_terminated_length": 213.0,
|
|
"tools/call_frequency": 4.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008946622721850872,
|
|
"sampling/sampling_logp_difference/max": 0.25611066818237305,
|
|
"sampling/importance_sampling_ratio/min": 0.6189490556716919,
|
|
"sampling/importance_sampling_ratio/mean": 1.1781431436538696,
|
|
"sampling/importance_sampling_ratio/max": 1.9483999013900757,
|
|
"entropy": 0.31166014447808266,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.413219831883907,
|
|
"epoch": 0.002942708333333333,
|
|
"step": 113
|
|
},
|
|
{
|
|
"loss": 0.09774579107761383,
|
|
"grad_norm": 6.762694835662842,
|
|
"learning_rate": 6.448275862068964e-07,
|
|
"num_tokens": 756072.0,
|
|
"completions/mean_length": 155.75,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 261.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 155.75,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 261.0,
|
|
"tools/call_frequency": 3.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010585418902337551,
|
|
"sampling/sampling_logp_difference/max": 0.3630194664001465,
|
|
"sampling/importance_sampling_ratio/min": 0.610520601272583,
|
|
"sampling/importance_sampling_ratio/mean": 0.9006423950195312,
|
|
"sampling/importance_sampling_ratio/max": 1.4365479946136475,
|
|
"entropy": 0.35176357068121433,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.380906347185373,
|
|
"epoch": 0.00296875,
|
|
"step": 114
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 6.413793103448275e-07,
|
|
"num_tokens": 762515.0,
|
|
"completions/mean_length": 119.0,
|
|
"completions/min_length": 73.0,
|
|
"completions/max_length": 209.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 119.0,
|
|
"completions/min_terminated_length": 73.0,
|
|
"completions/max_terminated_length": 209.0,
|
|
"tools/call_frequency": 2.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.007782564964145422,
|
|
"sampling/sampling_logp_difference/max": 0.19623231887817383,
|
|
"sampling/importance_sampling_ratio/min": 0.7612641453742981,
|
|
"sampling/importance_sampling_ratio/mean": 1.01596200466156,
|
|
"sampling/importance_sampling_ratio/max": 1.5096235275268555,
|
|
"entropy": 0.2919827215373516,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.673809587955475,
|
|
"epoch": 0.002994791666666667,
|
|
"step": 115
|
|
},
|
|
{
|
|
"loss": 0.6346048712730408,
|
|
"grad_norm": 11.39375114440918,
|
|
"learning_rate": 6.379310344827587e-07,
|
|
"num_tokens": 769519.0,
|
|
"completions/mean_length": 189.625,
|
|
"completions/min_length": 107.0,
|
|
"completions/max_length": 252.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 189.625,
|
|
"completions/min_terminated_length": 107.0,
|
|
"completions/max_terminated_length": 252.0,
|
|
"tools/call_frequency": 4.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.0116192027926445,
|
|
"sampling/sampling_logp_difference/max": 0.501544713973999,
|
|
"sampling/importance_sampling_ratio/min": 0.48311614990234375,
|
|
"sampling/importance_sampling_ratio/mean": 1.121081829071045,
|
|
"sampling/importance_sampling_ratio/max": 2.3119733333587646,
|
|
"entropy": 0.4275653772056103,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.685825224965811,
|
|
"epoch": 0.0030208333333333333,
|
|
"step": 116
|
|
},
|
|
{
|
|
"loss": 0.275103360414505,
|
|
"grad_norm": 6.650213241577148,
|
|
"learning_rate": 6.344827586206897e-07,
|
|
"num_tokens": 776222.0,
|
|
"completions/mean_length": 152.5,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 226.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 152.5,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 226.0,
|
|
"tools/call_frequency": 3.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009626222774386406,
|
|
"sampling/sampling_logp_difference/max": 0.37070217728614807,
|
|
"sampling/importance_sampling_ratio/min": 0.7094672322273254,
|
|
"sampling/importance_sampling_ratio/mean": 0.9113250374794006,
|
|
"sampling/importance_sampling_ratio/max": 1.0302008390426636,
|
|
"entropy": 0.3465727660804987,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.282361835241318,
|
|
"epoch": 0.003046875,
|
|
"step": 117
|
|
},
|
|
{
|
|
"loss": 0.5156227946281433,
|
|
"grad_norm": 12.00820541381836,
|
|
"learning_rate": 6.310344827586207e-07,
|
|
"num_tokens": 783016.0,
|
|
"completions/mean_length": 163.375,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 305.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 163.375,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 305.0,
|
|
"tools/call_frequency": 3.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010941405780613422,
|
|
"sampling/sampling_logp_difference/max": 0.33629274368286133,
|
|
"sampling/importance_sampling_ratio/min": 0.671073317527771,
|
|
"sampling/importance_sampling_ratio/mean": 1.1759719848632812,
|
|
"sampling/importance_sampling_ratio/max": 2.6716582775115967,
|
|
"entropy": 0.37467433512210846,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.680275987833738,
|
|
"epoch": 0.0030729166666666665,
|
|
"step": 118
|
|
},
|
|
{
|
|
"loss": 0.8407106995582581,
|
|
"grad_norm": 17.85860824584961,
|
|
"learning_rate": 6.275862068965517e-07,
|
|
"num_tokens": 789604.0,
|
|
"completions/mean_length": 138.375,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 214.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 138.375,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 214.0,
|
|
"tools/call_frequency": 3.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.007618207484483719,
|
|
"sampling/sampling_logp_difference/max": 0.5025027990341187,
|
|
"sampling/importance_sampling_ratio/min": 1.04802668094635,
|
|
"sampling/importance_sampling_ratio/mean": 1.4295008182525635,
|
|
"sampling/importance_sampling_ratio/max": 2.82423996925354,
|
|
"entropy": 0.27158435992896557,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.559630651026964,
|
|
"epoch": 0.0030989583333333333,
|
|
"step": 119
|
|
},
|
|
{
|
|
"loss": 0.2827949821949005,
|
|
"grad_norm": 8.021854400634766,
|
|
"learning_rate": 6.241379310344828e-07,
|
|
"num_tokens": 796059.0,
|
|
"completions/mean_length": 120.25,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 213.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 120.25,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 213.0,
|
|
"tools/call_frequency": 2.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010789177380502224,
|
|
"sampling/sampling_logp_difference/max": 0.340850830078125,
|
|
"sampling/importance_sampling_ratio/min": 0.5744712352752686,
|
|
"sampling/importance_sampling_ratio/mean": 1.0135583877563477,
|
|
"sampling/importance_sampling_ratio/max": 1.5326063632965088,
|
|
"entropy": 0.31681070290505886,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.3704073913395405,
|
|
"epoch": 0.003125,
|
|
"step": 120
|
|
},
|
|
{
|
|
"loss": -0.025903521105647087,
|
|
"grad_norm": 4.59657096862793,
|
|
"learning_rate": 6.206896551724138e-07,
|
|
"num_tokens": 802505.0,
|
|
"completions/mean_length": 120.75,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 221.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 120.75,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 221.0,
|
|
"tools/call_frequency": 2.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008937821723520756,
|
|
"sampling/sampling_logp_difference/max": 0.2381293773651123,
|
|
"sampling/importance_sampling_ratio/min": 0.4230496287345886,
|
|
"sampling/importance_sampling_ratio/mean": 0.9173972010612488,
|
|
"sampling/importance_sampling_ratio/max": 1.2072618007659912,
|
|
"entropy": 0.2807257492095232,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.378578908741474,
|
|
"epoch": 0.0031510416666666666,
|
|
"step": 121
|
|
},
|
|
{
|
|
"loss": 0.26725050806999207,
|
|
"grad_norm": 6.32208776473999,
|
|
"learning_rate": 6.172413793103448e-07,
|
|
"num_tokens": 809156.0,
|
|
"completions/mean_length": 145.875,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 221.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 145.875,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 221.0,
|
|
"tools/call_frequency": 3.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.00852217711508274,
|
|
"sampling/sampling_logp_difference/max": 0.32854509353637695,
|
|
"sampling/importance_sampling_ratio/min": 0.7225236892700195,
|
|
"sampling/importance_sampling_ratio/mean": 1.0455591678619385,
|
|
"sampling/importance_sampling_ratio/max": 1.5532008409500122,
|
|
"entropy": 0.3005763553082943,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.43068253621459,
|
|
"epoch": 0.0031770833333333334,
|
|
"step": 122
|
|
},
|
|
{
|
|
"loss": 0.4808719754219055,
|
|
"grad_norm": 8.258113861083984,
|
|
"learning_rate": 6.137931034482758e-07,
|
|
"num_tokens": 815806.0,
|
|
"completions/mean_length": 145.625,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 243.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 145.625,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 243.0,
|
|
"tools/call_frequency": 3.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008157098665833473,
|
|
"sampling/sampling_logp_difference/max": 0.22320938110351562,
|
|
"sampling/importance_sampling_ratio/min": 0.7562220096588135,
|
|
"sampling/importance_sampling_ratio/mean": 1.136099100112915,
|
|
"sampling/importance_sampling_ratio/max": 1.8109313249588013,
|
|
"entropy": 0.2966256979852915,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.4172316417098045,
|
|
"epoch": 0.003203125,
|
|
"step": 123
|
|
},
|
|
{
|
|
"loss": 0.5732248425483704,
|
|
"grad_norm": 16.379390716552734,
|
|
"learning_rate": 6.103448275862068e-07,
|
|
"num_tokens": 822109.0,
|
|
"completions/mean_length": 102.125,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 224.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 102.125,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 224.0,
|
|
"tools/call_frequency": 2.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008749508298933506,
|
|
"sampling/sampling_logp_difference/max": 0.25598084926605225,
|
|
"sampling/importance_sampling_ratio/min": 0.639359712600708,
|
|
"sampling/importance_sampling_ratio/mean": 0.9943200349807739,
|
|
"sampling/importance_sampling_ratio/max": 1.2689450979232788,
|
|
"entropy": 0.30843711271882057,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.309287916868925,
|
|
"epoch": 0.0032291666666666666,
|
|
"step": 124
|
|
},
|
|
{
|
|
"loss": 0.4618254005908966,
|
|
"grad_norm": 10.676800727844238,
|
|
"learning_rate": 6.068965517241379e-07,
|
|
"num_tokens": 828772.0,
|
|
"completions/mean_length": 147.0,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 262.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 147.0,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 262.0,
|
|
"tools/call_frequency": 3.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010596249252557755,
|
|
"sampling/sampling_logp_difference/max": 0.7496117353439331,
|
|
"sampling/importance_sampling_ratio/min": 0.4353272616863251,
|
|
"sampling/importance_sampling_ratio/mean": 0.9691989421844482,
|
|
"sampling/importance_sampling_ratio/max": 1.589128851890564,
|
|
"entropy": 0.3156683165580034,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.325103811919689,
|
|
"epoch": 0.0032552083333333335,
|
|
"step": 125
|
|
},
|
|
{
|
|
"loss": 0.1790747195482254,
|
|
"grad_norm": 4.7959370613098145,
|
|
"learning_rate": 6.03448275862069e-07,
|
|
"num_tokens": 835526.0,
|
|
"completions/mean_length": 158.75,
|
|
"completions/min_length": 70.0,
|
|
"completions/max_length": 248.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 158.75,
|
|
"completions/min_terminated_length": 70.0,
|
|
"completions/max_terminated_length": 248.0,
|
|
"tools/call_frequency": 3.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01063541229814291,
|
|
"sampling/sampling_logp_difference/max": 0.22961997985839844,
|
|
"sampling/importance_sampling_ratio/min": 0.3773084282875061,
|
|
"sampling/importance_sampling_ratio/mean": 0.825863778591156,
|
|
"sampling/importance_sampling_ratio/max": 1.1119177341461182,
|
|
"entropy": 0.3437854181975126,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.781949814409018,
|
|
"epoch": 0.00328125,
|
|
"step": 126
|
|
},
|
|
{
|
|
"loss": 0.23551371693611145,
|
|
"grad_norm": 6.73379373550415,
|
|
"learning_rate": 6e-07,
|
|
"num_tokens": 842385.0,
|
|
"completions/mean_length": 172.125,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 260.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 172.125,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 260.0,
|
|
"tools/call_frequency": 4.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011370385065674782,
|
|
"sampling/sampling_logp_difference/max": 0.405911922454834,
|
|
"sampling/importance_sampling_ratio/min": 0.30566754937171936,
|
|
"sampling/importance_sampling_ratio/mean": 0.9301817417144775,
|
|
"sampling/importance_sampling_ratio/max": 1.3651103973388672,
|
|
"entropy": 0.346507778391242,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.910211618989706,
|
|
"epoch": 0.0033072916666666667,
|
|
"step": 127
|
|
},
|
|
{
|
|
"loss": 0.2022474855184555,
|
|
"grad_norm": 5.945463180541992,
|
|
"learning_rate": 5.96551724137931e-07,
|
|
"num_tokens": 849044.0,
|
|
"completions/mean_length": 147.0,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 265.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 147.0,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 265.0,
|
|
"tools/call_frequency": 3.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010776746086776257,
|
|
"sampling/sampling_logp_difference/max": 0.23667407035827637,
|
|
"sampling/importance_sampling_ratio/min": 0.6757450103759766,
|
|
"sampling/importance_sampling_ratio/mean": 0.9513915181159973,
|
|
"sampling/importance_sampling_ratio/max": 1.2933709621429443,
|
|
"entropy": 0.38165279291570187,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.643797766417265,
|
|
"epoch": 0.0033333333333333335,
|
|
"step": 128
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 5.93103448275862e-07,
|
|
"num_tokens": 855708.0,
|
|
"completions/mean_length": 146.75,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 242.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 146.75,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 242.0,
|
|
"tools/call_frequency": 3.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.0092051662504673,
|
|
"sampling/sampling_logp_difference/max": 0.3924950361251831,
|
|
"sampling/importance_sampling_ratio/min": 0.6075559258460999,
|
|
"sampling/importance_sampling_ratio/mean": 0.9896328449249268,
|
|
"sampling/importance_sampling_ratio/max": 1.5017863512039185,
|
|
"entropy": 0.3463828284293413,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.5251744240522385,
|
|
"epoch": 0.003359375,
|
|
"step": 129
|
|
},
|
|
{
|
|
"loss": 0.38643378019332886,
|
|
"grad_norm": 6.654504299163818,
|
|
"learning_rate": 5.89655172413793e-07,
|
|
"num_tokens": 862511.0,
|
|
"completions/mean_length": 164.875,
|
|
"completions/min_length": 83.0,
|
|
"completions/max_length": 235.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 164.875,
|
|
"completions/min_terminated_length": 83.0,
|
|
"completions/max_terminated_length": 235.0,
|
|
"tools/call_frequency": 4.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010791948065161705,
|
|
"sampling/sampling_logp_difference/max": 0.23099565505981445,
|
|
"sampling/importance_sampling_ratio/min": 0.41067779064178467,
|
|
"sampling/importance_sampling_ratio/mean": 0.9913187026977539,
|
|
"sampling/importance_sampling_ratio/max": 1.4988288879394531,
|
|
"entropy": 0.39549149572849274,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.7824774123728275,
|
|
"epoch": 0.0033854166666666668,
|
|
"step": 130
|
|
},
|
|
{
|
|
"loss": 0.22039467096328735,
|
|
"grad_norm": 6.21829080581665,
|
|
"learning_rate": 5.86206896551724e-07,
|
|
"num_tokens": 869214.0,
|
|
"completions/mean_length": 152.875,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 249.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 152.875,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 249.0,
|
|
"tools/call_frequency": 3.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010067283175885677,
|
|
"sampling/sampling_logp_difference/max": 0.3524649143218994,
|
|
"sampling/importance_sampling_ratio/min": 0.480991929769516,
|
|
"sampling/importance_sampling_ratio/mean": 0.9281871318817139,
|
|
"sampling/importance_sampling_ratio/max": 1.4045127630233765,
|
|
"entropy": 0.3497322015464306,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.732268910855055,
|
|
"epoch": 0.003411458333333333,
|
|
"step": 131
|
|
},
|
|
{
|
|
"loss": -0.0316716805100441,
|
|
"grad_norm": 9.690140724182129,
|
|
"learning_rate": 5.827586206896552e-07,
|
|
"num_tokens": 876082.0,
|
|
"completions/mean_length": 172.875,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 261.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 172.875,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 261.0,
|
|
"tools/call_frequency": 4.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010459067299962044,
|
|
"sampling/sampling_logp_difference/max": 0.5119318962097168,
|
|
"sampling/importance_sampling_ratio/min": 0.6052589416503906,
|
|
"sampling/importance_sampling_ratio/mean": 1.2895135879516602,
|
|
"sampling/importance_sampling_ratio/max": 2.734208106994629,
|
|
"entropy": 0.35428342036902905,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.711316466331482,
|
|
"epoch": 0.0034375,
|
|
"step": 132
|
|
},
|
|
{
|
|
"loss": 0.08035942912101746,
|
|
"grad_norm": 5.704185962677002,
|
|
"learning_rate": 5.793103448275862e-07,
|
|
"num_tokens": 882364.0,
|
|
"completions/mean_length": 99.75,
|
|
"completions/min_length": 65.0,
|
|
"completions/max_length": 218.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 99.75,
|
|
"completions/min_terminated_length": 65.0,
|
|
"completions/max_terminated_length": 218.0,
|
|
"tools/call_frequency": 2.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011121845804154873,
|
|
"sampling/sampling_logp_difference/max": 0.3112626075744629,
|
|
"sampling/importance_sampling_ratio/min": 0.4699535369873047,
|
|
"sampling/importance_sampling_ratio/mean": 0.8771479725837708,
|
|
"sampling/importance_sampling_ratio/max": 1.2009285688400269,
|
|
"entropy": 0.29472543112933636,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.868767715990543,
|
|
"epoch": 0.003463541666666667,
|
|
"step": 133
|
|
},
|
|
{
|
|
"loss": 0.3339073061943054,
|
|
"grad_norm": 8.164704322814941,
|
|
"learning_rate": 5.758620689655173e-07,
|
|
"num_tokens": 889143.0,
|
|
"completions/mean_length": 161.0,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 269.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 161.0,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 269.0,
|
|
"tools/call_frequency": 3.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01054984051734209,
|
|
"sampling/sampling_logp_difference/max": 0.24594974517822266,
|
|
"sampling/importance_sampling_ratio/min": 0.6299041509628296,
|
|
"sampling/importance_sampling_ratio/mean": 1.0245990753173828,
|
|
"sampling/importance_sampling_ratio/max": 1.4536675214767456,
|
|
"entropy": 0.3493700586259365,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.682643141597509,
|
|
"epoch": 0.0034895833333333333,
|
|
"step": 134
|
|
},
|
|
{
|
|
"loss": 0.8844559788703918,
|
|
"grad_norm": 9.89760971069336,
|
|
"learning_rate": 5.724137931034483e-07,
|
|
"num_tokens": 895864.0,
|
|
"completions/mean_length": 153.5,
|
|
"completions/min_length": 70.0,
|
|
"completions/max_length": 252.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 153.5,
|
|
"completions/min_terminated_length": 70.0,
|
|
"completions/max_terminated_length": 252.0,
|
|
"tools/call_frequency": 3.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011449676938354969,
|
|
"sampling/sampling_logp_difference/max": 0.38788652420043945,
|
|
"sampling/importance_sampling_ratio/min": 0.88230299949646,
|
|
"sampling/importance_sampling_ratio/mean": 1.2738628387451172,
|
|
"sampling/importance_sampling_ratio/max": 2.109377145767212,
|
|
"entropy": 0.3731806166470051,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.541810233145952,
|
|
"epoch": 0.003515625,
|
|
"step": 135
|
|
},
|
|
{
|
|
"loss": 0.13434669375419617,
|
|
"grad_norm": 5.815131664276123,
|
|
"learning_rate": 5.689655172413793e-07,
|
|
"num_tokens": 902263.0,
|
|
"completions/mean_length": 113.375,
|
|
"completions/min_length": 70.0,
|
|
"completions/max_length": 211.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 113.375,
|
|
"completions/min_terminated_length": 70.0,
|
|
"completions/max_terminated_length": 211.0,
|
|
"tools/call_frequency": 2.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012074402533471584,
|
|
"sampling/sampling_logp_difference/max": 0.28097081184387207,
|
|
"sampling/importance_sampling_ratio/min": 0.48622947931289673,
|
|
"sampling/importance_sampling_ratio/mean": 0.8854970932006836,
|
|
"sampling/importance_sampling_ratio/max": 1.2359530925750732,
|
|
"entropy": 0.3264181297272444,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.367224920541048,
|
|
"epoch": 0.0035416666666666665,
|
|
"step": 136
|
|
},
|
|
{
|
|
"loss": 0.07884258776903152,
|
|
"grad_norm": 7.055483341217041,
|
|
"learning_rate": 5.655172413793103e-07,
|
|
"num_tokens": 908765.0,
|
|
"completions/mean_length": 126.625,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 272.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 126.625,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 272.0,
|
|
"tools/call_frequency": 2.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011616985313594341,
|
|
"sampling/sampling_logp_difference/max": 0.29666805267333984,
|
|
"sampling/importance_sampling_ratio/min": 0.5381214618682861,
|
|
"sampling/importance_sampling_ratio/mean": 0.9300821423530579,
|
|
"sampling/importance_sampling_ratio/max": 1.3228057622909546,
|
|
"entropy": 0.4124498013406992,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.391462463885546,
|
|
"epoch": 0.0035677083333333333,
|
|
"step": 137
|
|
},
|
|
{
|
|
"loss": 0.6435405611991882,
|
|
"grad_norm": 11.429481506347656,
|
|
"learning_rate": 5.620689655172414e-07,
|
|
"num_tokens": 915381.0,
|
|
"completions/mean_length": 141.125,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 275.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 141.125,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 275.0,
|
|
"tools/call_frequency": 2.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01192566379904747,
|
|
"sampling/sampling_logp_difference/max": 0.3008649945259094,
|
|
"sampling/importance_sampling_ratio/min": 0.6619023084640503,
|
|
"sampling/importance_sampling_ratio/mean": 1.0313981771469116,
|
|
"sampling/importance_sampling_ratio/max": 1.6887017488479614,
|
|
"entropy": 0.3635614365339279,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.4945810325443745,
|
|
"epoch": 0.00359375,
|
|
"step": 138
|
|
},
|
|
{
|
|
"loss": 0.4657299518585205,
|
|
"grad_norm": 6.181362628936768,
|
|
"learning_rate": 5.586206896551724e-07,
|
|
"num_tokens": 922244.0,
|
|
"completions/mean_length": 171.875,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 327.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 171.875,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 327.0,
|
|
"tools/call_frequency": 3.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010941163636744022,
|
|
"sampling/sampling_logp_difference/max": 0.22705680131912231,
|
|
"sampling/importance_sampling_ratio/min": 0.537858784198761,
|
|
"sampling/importance_sampling_ratio/mean": 0.8851903676986694,
|
|
"sampling/importance_sampling_ratio/max": 1.3793160915374756,
|
|
"entropy": 0.38550532795488834,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.107820358127356,
|
|
"epoch": 0.0036197916666666666,
|
|
"step": 139
|
|
},
|
|
{
|
|
"loss": -0.10473527014255524,
|
|
"grad_norm": 5.893695831298828,
|
|
"learning_rate": 5.551724137931034e-07,
|
|
"num_tokens": 928940.0,
|
|
"completions/mean_length": 151.625,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 242.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 151.625,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 242.0,
|
|
"tools/call_frequency": 3.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.036250002682209015,
|
|
"rewards/reward_func/std": 0.019955307245254517,
|
|
"reward": 0.036250002682209015,
|
|
"reward_std": 0.019955307245254517,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011792115867137909,
|
|
"sampling/sampling_logp_difference/max": 0.6515421867370605,
|
|
"sampling/importance_sampling_ratio/min": 0.13460567593574524,
|
|
"sampling/importance_sampling_ratio/mean": 0.863896369934082,
|
|
"sampling/importance_sampling_ratio/max": 1.2930536270141602,
|
|
"entropy": 0.4071816857904196,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.9469256810843945,
|
|
"epoch": 0.0036458333333333334,
|
|
"step": 140
|
|
},
|
|
{
|
|
"loss": 0.36559128761291504,
|
|
"grad_norm": 7.0739874839782715,
|
|
"learning_rate": 5.517241379310344e-07,
|
|
"num_tokens": 935635.0,
|
|
"completions/mean_length": 150.75,
|
|
"completions/min_length": 77.0,
|
|
"completions/max_length": 244.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 150.75,
|
|
"completions/min_terminated_length": 77.0,
|
|
"completions/max_terminated_length": 244.0,
|
|
"tools/call_frequency": 3.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012012180872261524,
|
|
"sampling/sampling_logp_difference/max": 0.8238973617553711,
|
|
"sampling/importance_sampling_ratio/min": 0.551522433757782,
|
|
"sampling/importance_sampling_ratio/mean": 0.9712069630622864,
|
|
"sampling/importance_sampling_ratio/max": 1.5781205892562866,
|
|
"entropy": 0.3758638817816973,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.235336318612099,
|
|
"epoch": 0.003671875,
|
|
"step": 141
|
|
},
|
|
{
|
|
"loss": 0.5909204483032227,
|
|
"grad_norm": 10.78104019165039,
|
|
"learning_rate": 5.482758620689654e-07,
|
|
"num_tokens": 942039.0,
|
|
"completions/mean_length": 115.125,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 221.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 115.125,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 221.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009524553082883358,
|
|
"sampling/sampling_logp_difference/max": 0.34715771675109863,
|
|
"sampling/importance_sampling_ratio/min": 0.7241600751876831,
|
|
"sampling/importance_sampling_ratio/mean": 1.020354151725769,
|
|
"sampling/importance_sampling_ratio/max": 1.5488468408584595,
|
|
"entropy": 0.3125888742506504,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.358454208821058,
|
|
"epoch": 0.0036979166666666666,
|
|
"step": 142
|
|
},
|
|
{
|
|
"loss": 0.371610552072525,
|
|
"grad_norm": 9.44663143157959,
|
|
"learning_rate": 5.448275862068966e-07,
|
|
"num_tokens": 948420.0,
|
|
"completions/mean_length": 111.5,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 223.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 111.5,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 223.0,
|
|
"tools/call_frequency": 2.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010900081135332584,
|
|
"sampling/sampling_logp_difference/max": 0.23548507690429688,
|
|
"sampling/importance_sampling_ratio/min": 0.6133748888969421,
|
|
"sampling/importance_sampling_ratio/mean": 0.877676248550415,
|
|
"sampling/importance_sampling_ratio/max": 1.3901312351226807,
|
|
"entropy": 0.34686912782490253,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.447076119482517,
|
|
"epoch": 0.0037239583333333335,
|
|
"step": 143
|
|
},
|
|
{
|
|
"loss": 0.5922117233276367,
|
|
"grad_norm": 13.413734436035156,
|
|
"learning_rate": 5.413793103448276e-07,
|
|
"num_tokens": 955037.0,
|
|
"completions/mean_length": 141.25,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 365.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 141.25,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 365.0,
|
|
"tools/call_frequency": 2.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01297376025468111,
|
|
"sampling/sampling_logp_difference/max": 0.23618745803833008,
|
|
"sampling/importance_sampling_ratio/min": 0.3555481731891632,
|
|
"sampling/importance_sampling_ratio/mean": 1.0578644275665283,
|
|
"sampling/importance_sampling_ratio/max": 1.6765522956848145,
|
|
"entropy": 0.39507456310093403,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.79993000254035,
|
|
"epoch": 0.00375,
|
|
"step": 144
|
|
},
|
|
{
|
|
"loss": 0.23630912601947784,
|
|
"grad_norm": 5.603333473205566,
|
|
"learning_rate": 5.379310344827586e-07,
|
|
"num_tokens": 961729.0,
|
|
"completions/mean_length": 151.125,
|
|
"completions/min_length": 76.0,
|
|
"completions/max_length": 236.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 151.125,
|
|
"completions/min_terminated_length": 76.0,
|
|
"completions/max_terminated_length": 236.0,
|
|
"tools/call_frequency": 3.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010452363640069962,
|
|
"sampling/sampling_logp_difference/max": 0.6782970428466797,
|
|
"sampling/importance_sampling_ratio/min": 0.2544386088848114,
|
|
"sampling/importance_sampling_ratio/mean": 0.8308250904083252,
|
|
"sampling/importance_sampling_ratio/max": 1.352867603302002,
|
|
"entropy": 0.35167958959937096,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.475310180336237,
|
|
"epoch": 0.0037760416666666667,
|
|
"step": 145
|
|
},
|
|
{
|
|
"loss": -0.1252993643283844,
|
|
"grad_norm": 5.965582370758057,
|
|
"learning_rate": 5.344827586206896e-07,
|
|
"num_tokens": 968330.0,
|
|
"completions/mean_length": 139.625,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 231.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 139.625,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 231.0,
|
|
"tools/call_frequency": 2.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010536031797528267,
|
|
"sampling/sampling_logp_difference/max": 0.22926044464111328,
|
|
"sampling/importance_sampling_ratio/min": 0.33621829748153687,
|
|
"sampling/importance_sampling_ratio/mean": 1.0802295207977295,
|
|
"sampling/importance_sampling_ratio/max": 1.9177711009979248,
|
|
"entropy": 0.4332877267152071,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.348659306764603,
|
|
"epoch": 0.0038020833333333335,
|
|
"step": 146
|
|
},
|
|
{
|
|
"loss": 0.2816794216632843,
|
|
"grad_norm": 10.91917896270752,
|
|
"learning_rate": 5.310344827586206e-07,
|
|
"num_tokens": 975025.0,
|
|
"completions/mean_length": 151.25,
|
|
"completions/min_length": 72.0,
|
|
"completions/max_length": 220.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 151.25,
|
|
"completions/min_terminated_length": 72.0,
|
|
"completions/max_terminated_length": 220.0,
|
|
"tools/call_frequency": 3.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011163009330630302,
|
|
"sampling/sampling_logp_difference/max": 0.27510547637939453,
|
|
"sampling/importance_sampling_ratio/min": 0.7145137190818787,
|
|
"sampling/importance_sampling_ratio/mean": 1.2337570190429688,
|
|
"sampling/importance_sampling_ratio/max": 2.066477060317993,
|
|
"entropy": 0.3741652797907591,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.513817120343447,
|
|
"epoch": 0.003828125,
|
|
"step": 147
|
|
},
|
|
{
|
|
"loss": 0.15150494873523712,
|
|
"grad_norm": 4.9359049797058105,
|
|
"learning_rate": 5.275862068965517e-07,
|
|
"num_tokens": 981809.0,
|
|
"completions/mean_length": 161.875,
|
|
"completions/min_length": 70.0,
|
|
"completions/max_length": 241.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 161.875,
|
|
"completions/min_terminated_length": 70.0,
|
|
"completions/max_terminated_length": 241.0,
|
|
"tools/call_frequency": 3.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526474453508854,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009888200089335442,
|
|
"sampling/sampling_logp_difference/max": 0.18794631958007812,
|
|
"sampling/importance_sampling_ratio/min": 0.5370185971260071,
|
|
"sampling/importance_sampling_ratio/mean": 0.8451970815658569,
|
|
"sampling/importance_sampling_ratio/max": 1.2252720594406128,
|
|
"entropy": 0.3730885051190853,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.422040428966284,
|
|
"epoch": 0.0038541666666666668,
|
|
"step": 148
|
|
},
|
|
{
|
|
"loss": 0.03353673964738846,
|
|
"grad_norm": 5.289402961730957,
|
|
"learning_rate": 5.241379310344828e-07,
|
|
"num_tokens": 988166.0,
|
|
"completions/mean_length": 109.0,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 253.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 109.0,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 253.0,
|
|
"tools/call_frequency": 2.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009996372275054455,
|
|
"sampling/sampling_logp_difference/max": 0.24192500114440918,
|
|
"sampling/importance_sampling_ratio/min": 0.37206289172172546,
|
|
"sampling/importance_sampling_ratio/mean": 0.9003746509552002,
|
|
"sampling/importance_sampling_ratio/max": 1.3345550298690796,
|
|
"entropy": 0.3364357128739357,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.124768618494272,
|
|
"epoch": 0.003880208333333333,
|
|
"step": 149
|
|
},
|
|
{
|
|
"loss": 0.4561821520328522,
|
|
"grad_norm": 5.345966339111328,
|
|
"learning_rate": 5.206896551724138e-07,
|
|
"num_tokens": 995306.0,
|
|
"completions/mean_length": 207.25,
|
|
"completions/min_length": 72.0,
|
|
"completions/max_length": 310.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 207.25,
|
|
"completions/min_terminated_length": 72.0,
|
|
"completions/max_terminated_length": 310.0,
|
|
"tools/call_frequency": 4.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03125,
|
|
"rewards/reward_func/std": 0.015526474453508854,
|
|
"reward": 0.03125,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013141309842467308,
|
|
"sampling/sampling_logp_difference/max": 0.2841451168060303,
|
|
"sampling/importance_sampling_ratio/min": 0.4366952180862427,
|
|
"sampling/importance_sampling_ratio/mean": 0.9153301119804382,
|
|
"sampling/importance_sampling_ratio/max": 1.668927550315857,
|
|
"entropy": 0.45230007730424404,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.826663624495268,
|
|
"epoch": 0.00390625,
|
|
"step": 150
|
|
},
|
|
{
|
|
"loss": 0.11600668728351593,
|
|
"grad_norm": 5.187719821929932,
|
|
"learning_rate": 5.172413793103448e-07,
|
|
"num_tokens": 1002074.0,
|
|
"completions/mean_length": 159.625,
|
|
"completions/min_length": 74.0,
|
|
"completions/max_length": 228.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 159.625,
|
|
"completions/min_terminated_length": 74.0,
|
|
"completions/max_terminated_length": 228.0,
|
|
"tools/call_frequency": 3.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010474211536347866,
|
|
"sampling/sampling_logp_difference/max": 0.22877717018127441,
|
|
"sampling/importance_sampling_ratio/min": 0.41867905855178833,
|
|
"sampling/importance_sampling_ratio/mean": 0.7981000542640686,
|
|
"sampling/importance_sampling_ratio/max": 1.3060157299041748,
|
|
"entropy": 0.3814409375190735,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.408076927065849,
|
|
"epoch": 0.003932291666666666,
|
|
"step": 151
|
|
},
|
|
{
|
|
"loss": 0.22497065365314484,
|
|
"grad_norm": 9.38429069519043,
|
|
"learning_rate": 5.137931034482759e-07,
|
|
"num_tokens": 1008519.0,
|
|
"completions/mean_length": 120.625,
|
|
"completions/min_length": 77.0,
|
|
"completions/max_length": 254.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 120.625,
|
|
"completions/min_terminated_length": 77.0,
|
|
"completions/max_terminated_length": 254.0,
|
|
"tools/call_frequency": 2.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01106168981641531,
|
|
"sampling/sampling_logp_difference/max": 0.46137118339538574,
|
|
"sampling/importance_sampling_ratio/min": 0.6133219599723816,
|
|
"sampling/importance_sampling_ratio/mean": 0.981549859046936,
|
|
"sampling/importance_sampling_ratio/max": 1.3719937801361084,
|
|
"entropy": 0.3602590449154377,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.429544303566217,
|
|
"epoch": 0.003958333333333334,
|
|
"step": 152
|
|
},
|
|
{
|
|
"loss": 0.14659032225608826,
|
|
"grad_norm": 4.5607805252075195,
|
|
"learning_rate": 5.103448275862069e-07,
|
|
"num_tokens": 1015204.0,
|
|
"completions/mean_length": 149.625,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 239.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 149.625,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 239.0,
|
|
"tools/call_frequency": 3.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01044460292905569,
|
|
"sampling/sampling_logp_difference/max": 0.23629188537597656,
|
|
"sampling/importance_sampling_ratio/min": 0.43308189511299133,
|
|
"sampling/importance_sampling_ratio/mean": 0.6988573670387268,
|
|
"sampling/importance_sampling_ratio/max": 1.0475229024887085,
|
|
"entropy": 0.38442783057689667,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.722482580691576,
|
|
"epoch": 0.003984375,
|
|
"step": 153
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 5.068965517241379e-07,
|
|
"num_tokens": 1021642.0,
|
|
"completions/mean_length": 119.25,
|
|
"completions/min_length": 75.0,
|
|
"completions/max_length": 185.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 119.25,
|
|
"completions/min_terminated_length": 75.0,
|
|
"completions/max_terminated_length": 185.0,
|
|
"tools/call_frequency": 2.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010814960114657879,
|
|
"sampling/sampling_logp_difference/max": 0.2301645278930664,
|
|
"sampling/importance_sampling_ratio/min": 0.6734923720359802,
|
|
"sampling/importance_sampling_ratio/mean": 1.030893325805664,
|
|
"sampling/importance_sampling_ratio/max": 1.6214594841003418,
|
|
"entropy": 0.37780166044831276,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.066457532346249,
|
|
"epoch": 0.0040104166666666665,
|
|
"step": 154
|
|
},
|
|
{
|
|
"loss": 0.09276268631219864,
|
|
"grad_norm": 6.388376235961914,
|
|
"learning_rate": 5.03448275862069e-07,
|
|
"num_tokens": 1028042.0,
|
|
"completions/mean_length": 114.25,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 199.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 114.25,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 199.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008938313461840153,
|
|
"sampling/sampling_logp_difference/max": 0.35042858123779297,
|
|
"sampling/importance_sampling_ratio/min": 0.7779285311698914,
|
|
"sampling/importance_sampling_ratio/mean": 1.13539457321167,
|
|
"sampling/importance_sampling_ratio/max": 1.635698914527893,
|
|
"entropy": 0.3467178996652365,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.420503478497267,
|
|
"epoch": 0.004036458333333334,
|
|
"step": 155
|
|
},
|
|
{
|
|
"loss": 0.30706319212913513,
|
|
"grad_norm": 7.921052932739258,
|
|
"learning_rate": 5e-07,
|
|
"num_tokens": 1034644.0,
|
|
"completions/mean_length": 138.125,
|
|
"completions/min_length": 64.0,
|
|
"completions/max_length": 236.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 138.125,
|
|
"completions/min_terminated_length": 64.0,
|
|
"completions/max_terminated_length": 236.0,
|
|
"tools/call_frequency": 3.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009582938626408577,
|
|
"sampling/sampling_logp_difference/max": 0.2107241153717041,
|
|
"sampling/importance_sampling_ratio/min": 0.9497532248497009,
|
|
"sampling/importance_sampling_ratio/mean": 1.1179430484771729,
|
|
"sampling/importance_sampling_ratio/max": 1.4074989557266235,
|
|
"entropy": 0.3807706218212843,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.399908613413572,
|
|
"epoch": 0.0040625,
|
|
"step": 156
|
|
},
|
|
{
|
|
"loss": 0.15914547443389893,
|
|
"grad_norm": 8.622142791748047,
|
|
"learning_rate": 4.96551724137931e-07,
|
|
"num_tokens": 1041147.0,
|
|
"completions/mean_length": 127.5,
|
|
"completions/min_length": 74.0,
|
|
"completions/max_length": 263.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 127.5,
|
|
"completions/min_terminated_length": 74.0,
|
|
"completions/max_terminated_length": 263.0,
|
|
"tools/call_frequency": 2.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010321034118533134,
|
|
"sampling/sampling_logp_difference/max": 0.2393045425415039,
|
|
"sampling/importance_sampling_ratio/min": 0.5923110246658325,
|
|
"sampling/importance_sampling_ratio/mean": 1.0897908210754395,
|
|
"sampling/importance_sampling_ratio/max": 1.5215054750442505,
|
|
"entropy": 0.34646858647465706,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.144720334559679,
|
|
"epoch": 0.0040885416666666665,
|
|
"step": 157
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 4.93103448275862e-07,
|
|
"num_tokens": 1047377.0,
|
|
"completions/mean_length": 92.625,
|
|
"completions/min_length": 66.0,
|
|
"completions/max_length": 224.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 92.625,
|
|
"completions/min_terminated_length": 66.0,
|
|
"completions/max_terminated_length": 224.0,
|
|
"tools/call_frequency": 1.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011111222207546234,
|
|
"sampling/sampling_logp_difference/max": 0.23401474952697754,
|
|
"sampling/importance_sampling_ratio/min": 0.596598744392395,
|
|
"sampling/importance_sampling_ratio/mean": 1.0669481754302979,
|
|
"sampling/importance_sampling_ratio/max": 1.743268370628357,
|
|
"entropy": 0.3270287439227104,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.059169597923756,
|
|
"epoch": 0.004114583333333333,
|
|
"step": 158
|
|
},
|
|
{
|
|
"loss": 0.8481175899505615,
|
|
"grad_norm": 14.032878875732422,
|
|
"learning_rate": 4.89655172413793e-07,
|
|
"num_tokens": 1054176.0,
|
|
"completions/mean_length": 164.375,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 262.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 164.375,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 262.0,
|
|
"tools/call_frequency": 3.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013288868591189384,
|
|
"sampling/sampling_logp_difference/max": 0.2288370132446289,
|
|
"sampling/importance_sampling_ratio/min": 0.660346269607544,
|
|
"sampling/importance_sampling_ratio/mean": 1.1337367296218872,
|
|
"sampling/importance_sampling_ratio/max": 2.779522657394409,
|
|
"entropy": 0.43657696805894375,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.542712081223726,
|
|
"epoch": 0.004140625,
|
|
"step": 159
|
|
},
|
|
{
|
|
"loss": 0.2928353548049927,
|
|
"grad_norm": 6.743988990783691,
|
|
"learning_rate": 4.86206896551724e-07,
|
|
"num_tokens": 1060751.0,
|
|
"completions/mean_length": 135.125,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 225.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 135.125,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 225.0,
|
|
"tools/call_frequency": 3.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526474453508854,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01074211299419403,
|
|
"sampling/sampling_logp_difference/max": 0.29061341285705566,
|
|
"sampling/importance_sampling_ratio/min": 0.701608419418335,
|
|
"sampling/importance_sampling_ratio/mean": 0.9121615886688232,
|
|
"sampling/importance_sampling_ratio/max": 1.264937162399292,
|
|
"entropy": 0.37345817871391773,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.707511655986309,
|
|
"epoch": 0.004166666666666667,
|
|
"step": 160
|
|
},
|
|
{
|
|
"loss": 0.27348294854164124,
|
|
"grad_norm": 8.389760971069336,
|
|
"learning_rate": 4.827586206896552e-07,
|
|
"num_tokens": 1067521.0,
|
|
"completions/mean_length": 160.5,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 253.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 160.5,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 253.0,
|
|
"tools/call_frequency": 3.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012955406680703163,
|
|
"sampling/sampling_logp_difference/max": 0.30843019485473633,
|
|
"sampling/importance_sampling_ratio/min": 0.3167129158973694,
|
|
"sampling/importance_sampling_ratio/mean": 0.9492311477661133,
|
|
"sampling/importance_sampling_ratio/max": 1.5266128778457642,
|
|
"entropy": 0.4168580323457718,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.507475238293409,
|
|
"epoch": 0.004192708333333333,
|
|
"step": 161
|
|
},
|
|
{
|
|
"loss": 0.46580934524536133,
|
|
"grad_norm": 12.362199783325195,
|
|
"learning_rate": 4.793103448275862e-07,
|
|
"num_tokens": 1074312.0,
|
|
"completions/mean_length": 162.875,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 315.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 162.875,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 315.0,
|
|
"tools/call_frequency": 3.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01365566160529852,
|
|
"sampling/sampling_logp_difference/max": 0.23987793922424316,
|
|
"sampling/importance_sampling_ratio/min": 0.451067715883255,
|
|
"sampling/importance_sampling_ratio/mean": 1.221800446510315,
|
|
"sampling/importance_sampling_ratio/max": 2.9149608612060547,
|
|
"entropy": 0.4211210086941719,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.599305208772421,
|
|
"epoch": 0.00421875,
|
|
"step": 162
|
|
},
|
|
{
|
|
"loss": 0.7719423770904541,
|
|
"grad_norm": 11.908933639526367,
|
|
"learning_rate": 4.7586206896551725e-07,
|
|
"num_tokens": 1080890.0,
|
|
"completions/mean_length": 136.75,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 267.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 136.75,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 267.0,
|
|
"tools/call_frequency": 2.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011187504976987839,
|
|
"sampling/sampling_logp_difference/max": 0.22979331016540527,
|
|
"sampling/importance_sampling_ratio/min": 0.7769345045089722,
|
|
"sampling/importance_sampling_ratio/mean": 1.0808329582214355,
|
|
"sampling/importance_sampling_ratio/max": 1.9545265436172485,
|
|
"entropy": 0.3350531365722418,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.403560355305672,
|
|
"epoch": 0.004244791666666667,
|
|
"step": 163
|
|
},
|
|
{
|
|
"loss": -0.023511650040745735,
|
|
"grad_norm": 4.579489707946777,
|
|
"learning_rate": 4.7241379310344827e-07,
|
|
"num_tokens": 1087506.0,
|
|
"completions/mean_length": 141.0,
|
|
"completions/min_length": 82.0,
|
|
"completions/max_length": 214.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 141.0,
|
|
"completions/min_terminated_length": 82.0,
|
|
"completions/max_terminated_length": 214.0,
|
|
"tools/call_frequency": 3.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009542525745928288,
|
|
"sampling/sampling_logp_difference/max": 0.25358736515045166,
|
|
"sampling/importance_sampling_ratio/min": 0.5355388522148132,
|
|
"sampling/importance_sampling_ratio/mean": 0.9319785833358765,
|
|
"sampling/importance_sampling_ratio/max": 1.3638423681259155,
|
|
"entropy": 0.3927879575639963,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.409089520573616,
|
|
"epoch": 0.004270833333333333,
|
|
"step": 164
|
|
},
|
|
{
|
|
"loss": 0.6146892309188843,
|
|
"grad_norm": 11.655983924865723,
|
|
"learning_rate": 4.689655172413793e-07,
|
|
"num_tokens": 1093951.0,
|
|
"completions/mean_length": 119.375,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 271.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 119.375,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 271.0,
|
|
"tools/call_frequency": 2.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.0130855618044734,
|
|
"sampling/sampling_logp_difference/max": 0.3415532112121582,
|
|
"sampling/importance_sampling_ratio/min": 0.6998491883277893,
|
|
"sampling/importance_sampling_ratio/mean": 0.9789403080940247,
|
|
"sampling/importance_sampling_ratio/max": 1.2991653680801392,
|
|
"entropy": 0.35031095892190933,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.084268372505903,
|
|
"epoch": 0.004296875,
|
|
"step": 165
|
|
},
|
|
{
|
|
"loss": 0.2628885805606842,
|
|
"grad_norm": 9.257012367248535,
|
|
"learning_rate": 4.655172413793103e-07,
|
|
"num_tokens": 1100277.0,
|
|
"completions/mean_length": 105.0,
|
|
"completions/min_length": 66.0,
|
|
"completions/max_length": 248.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 105.0,
|
|
"completions/min_terminated_length": 66.0,
|
|
"completions/max_terminated_length": 248.0,
|
|
"tools/call_frequency": 2.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011025010608136654,
|
|
"sampling/sampling_logp_difference/max": 0.4657559394836426,
|
|
"sampling/importance_sampling_ratio/min": 0.6272523999214172,
|
|
"sampling/importance_sampling_ratio/mean": 0.9330089092254639,
|
|
"sampling/importance_sampling_ratio/max": 1.1947609186172485,
|
|
"entropy": 0.3005186766386032,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.44056111946702,
|
|
"epoch": 0.004322916666666667,
|
|
"step": 166
|
|
},
|
|
{
|
|
"loss": 0.3473038375377655,
|
|
"grad_norm": 11.237125396728516,
|
|
"learning_rate": 4.620689655172413e-07,
|
|
"num_tokens": 1107273.0,
|
|
"completions/mean_length": 188.625,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 290.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 188.625,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 290.0,
|
|
"tools/call_frequency": 4.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011958522722125053,
|
|
"sampling/sampling_logp_difference/max": 0.2396981120109558,
|
|
"sampling/importance_sampling_ratio/min": 0.5938199758529663,
|
|
"sampling/importance_sampling_ratio/mean": 1.2082080841064453,
|
|
"sampling/importance_sampling_ratio/max": 2.1477696895599365,
|
|
"entropy": 0.43346363492310047,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.647990759462118,
|
|
"epoch": 0.004348958333333333,
|
|
"step": 167
|
|
},
|
|
{
|
|
"loss": 0.375881552696228,
|
|
"grad_norm": 11.231345176696777,
|
|
"learning_rate": 4.586206896551724e-07,
|
|
"num_tokens": 1113930.0,
|
|
"completions/mean_length": 146.875,
|
|
"completions/min_length": 72.0,
|
|
"completions/max_length": 309.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 146.875,
|
|
"completions/min_terminated_length": 72.0,
|
|
"completions/max_terminated_length": 309.0,
|
|
"tools/call_frequency": 2.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012398858554661274,
|
|
"sampling/sampling_logp_difference/max": 0.35318946838378906,
|
|
"sampling/importance_sampling_ratio/min": 0.592577338218689,
|
|
"sampling/importance_sampling_ratio/mean": 0.9523167610168457,
|
|
"sampling/importance_sampling_ratio/max": 1.5916956663131714,
|
|
"entropy": 0.36419576592743397,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.841407876461744,
|
|
"epoch": 0.004375,
|
|
"step": 168
|
|
},
|
|
{
|
|
"loss": 0.369973361492157,
|
|
"grad_norm": 8.31087589263916,
|
|
"learning_rate": 4.5517241379310346e-07,
|
|
"num_tokens": 1120637.0,
|
|
"completions/mean_length": 152.5,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 271.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 152.5,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 271.0,
|
|
"tools/call_frequency": 3.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01190831046551466,
|
|
"sampling/sampling_logp_difference/max": 0.24907875061035156,
|
|
"sampling/importance_sampling_ratio/min": 0.6186512112617493,
|
|
"sampling/importance_sampling_ratio/mean": 0.9450300931930542,
|
|
"sampling/importance_sampling_ratio/max": 1.15328049659729,
|
|
"entropy": 0.38446491956710815,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.545520156621933,
|
|
"epoch": 0.004401041666666667,
|
|
"step": 169
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 4.5172413793103447e-07,
|
|
"num_tokens": 1126989.0,
|
|
"completions/mean_length": 107.875,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 212.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 107.875,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 212.0,
|
|
"tools/call_frequency": 2.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009688830934464931,
|
|
"sampling/sampling_logp_difference/max": 0.21934986114501953,
|
|
"sampling/importance_sampling_ratio/min": 0.568965494632721,
|
|
"sampling/importance_sampling_ratio/mean": 1.0050801038742065,
|
|
"sampling/importance_sampling_ratio/max": 1.726969838142395,
|
|
"entropy": 0.345406549051404,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.232211943715811,
|
|
"epoch": 0.004427083333333333,
|
|
"step": 170
|
|
},
|
|
{
|
|
"loss": 0.0018211621791124344,
|
|
"grad_norm": 3.5631000995635986,
|
|
"learning_rate": 4.482758620689655e-07,
|
|
"num_tokens": 1133588.0,
|
|
"completions/mean_length": 138.5,
|
|
"completions/min_length": 80.0,
|
|
"completions/max_length": 247.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 138.5,
|
|
"completions/min_terminated_length": 80.0,
|
|
"completions/max_terminated_length": 247.0,
|
|
"tools/call_frequency": 2.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012644898146390915,
|
|
"sampling/sampling_logp_difference/max": 0.3246300220489502,
|
|
"sampling/importance_sampling_ratio/min": 0.3674854636192322,
|
|
"sampling/importance_sampling_ratio/mean": 0.6914317011833191,
|
|
"sampling/importance_sampling_ratio/max": 1.0202902555465698,
|
|
"entropy": 0.4186480715870857,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.439485292881727,
|
|
"epoch": 0.004453125,
|
|
"step": 171
|
|
},
|
|
{
|
|
"loss": 0.23380541801452637,
|
|
"grad_norm": 7.386971950531006,
|
|
"learning_rate": 4.4482758620689656e-07,
|
|
"num_tokens": 1140145.0,
|
|
"completions/mean_length": 134.25,
|
|
"completions/min_length": 57.0,
|
|
"completions/max_length": 248.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 134.25,
|
|
"completions/min_terminated_length": 57.0,
|
|
"completions/max_terminated_length": 248.0,
|
|
"tools/call_frequency": 2.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010394912213087082,
|
|
"sampling/sampling_logp_difference/max": 0.23205900192260742,
|
|
"sampling/importance_sampling_ratio/min": 0.6111149787902832,
|
|
"sampling/importance_sampling_ratio/mean": 1.074774146080017,
|
|
"sampling/importance_sampling_ratio/max": 1.4737930297851562,
|
|
"entropy": 0.40662066638469696,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.4265474528074265,
|
|
"epoch": 0.004479166666666667,
|
|
"step": 172
|
|
},
|
|
{
|
|
"loss": 0.2922966778278351,
|
|
"grad_norm": 7.548577308654785,
|
|
"learning_rate": 4.413793103448276e-07,
|
|
"num_tokens": 1146698.0,
|
|
"completions/mean_length": 133.75,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 225.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 133.75,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 225.0,
|
|
"tools/call_frequency": 3.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.0100996233522892,
|
|
"sampling/sampling_logp_difference/max": 0.24335050582885742,
|
|
"sampling/importance_sampling_ratio/min": 0.8184927701950073,
|
|
"sampling/importance_sampling_ratio/mean": 1.0778617858886719,
|
|
"sampling/importance_sampling_ratio/max": 1.5109097957611084,
|
|
"entropy": 0.34739658795297146,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.289377816021442,
|
|
"epoch": 0.004505208333333333,
|
|
"step": 173
|
|
},
|
|
{
|
|
"loss": -0.11277288943529129,
|
|
"grad_norm": 6.575459957122803,
|
|
"learning_rate": 4.379310344827586e-07,
|
|
"num_tokens": 1152977.0,
|
|
"completions/mean_length": 99.875,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 209.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 99.875,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 209.0,
|
|
"tools/call_frequency": 1.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011082465760409832,
|
|
"sampling/sampling_logp_difference/max": 0.8528811931610107,
|
|
"sampling/importance_sampling_ratio/min": 0.2814207077026367,
|
|
"sampling/importance_sampling_ratio/mean": 0.7343454360961914,
|
|
"sampling/importance_sampling_ratio/max": 1.3050929307937622,
|
|
"entropy": 0.3079978320747614,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.172449450939894,
|
|
"epoch": 0.00453125,
|
|
"step": 174
|
|
},
|
|
{
|
|
"loss": 0.25698673725128174,
|
|
"grad_norm": 6.957929611206055,
|
|
"learning_rate": 4.344827586206896e-07,
|
|
"num_tokens": 1159541.0,
|
|
"completions/mean_length": 135.125,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 260.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 135.125,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 260.0,
|
|
"tools/call_frequency": 2.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011162425391376019,
|
|
"sampling/sampling_logp_difference/max": 0.20833706855773926,
|
|
"sampling/importance_sampling_ratio/min": 0.45818760991096497,
|
|
"sampling/importance_sampling_ratio/mean": 0.869988739490509,
|
|
"sampling/importance_sampling_ratio/max": 1.1792570352554321,
|
|
"entropy": 0.3767632134258747,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.697212811559439,
|
|
"epoch": 0.004557291666666667,
|
|
"step": 175
|
|
},
|
|
{
|
|
"loss": 0.8612809181213379,
|
|
"grad_norm": 16.8394832611084,
|
|
"learning_rate": 4.310344827586206e-07,
|
|
"num_tokens": 1166375.0,
|
|
"completions/mean_length": 169.0,
|
|
"completions/min_length": 99.0,
|
|
"completions/max_length": 267.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 169.0,
|
|
"completions/min_terminated_length": 99.0,
|
|
"completions/max_terminated_length": 267.0,
|
|
"tools/call_frequency": 3.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010630536824464798,
|
|
"sampling/sampling_logp_difference/max": 0.27670979499816895,
|
|
"sampling/importance_sampling_ratio/min": 0.7076943516731262,
|
|
"sampling/importance_sampling_ratio/mean": 1.3311774730682373,
|
|
"sampling/importance_sampling_ratio/max": 2.9949889183044434,
|
|
"entropy": 0.4005416538566351,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.0489320158958435,
|
|
"epoch": 0.004583333333333333,
|
|
"step": 176
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 4.2758620689655174e-07,
|
|
"num_tokens": 1172554.0,
|
|
"completions/mean_length": 86.75,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 184.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 86.75,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 184.0,
|
|
"tools/call_frequency": 1.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01007942296564579,
|
|
"sampling/sampling_logp_difference/max": 0.19375240802764893,
|
|
"sampling/importance_sampling_ratio/min": 0.7981061339378357,
|
|
"sampling/importance_sampling_ratio/mean": 0.9341230392456055,
|
|
"sampling/importance_sampling_ratio/max": 1.1046969890594482,
|
|
"entropy": 0.28836890682578087,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 3.929526772350073,
|
|
"epoch": 0.004609375,
|
|
"step": 177
|
|
},
|
|
{
|
|
"loss": 0.05435868725180626,
|
|
"grad_norm": 5.189301490783691,
|
|
"learning_rate": 4.2413793103448276e-07,
|
|
"num_tokens": 1178983.0,
|
|
"completions/mean_length": 117.75,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 193.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 117.75,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 193.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008957152254879475,
|
|
"sampling/sampling_logp_difference/max": 0.2768409252166748,
|
|
"sampling/importance_sampling_ratio/min": 0.5556984543800354,
|
|
"sampling/importance_sampling_ratio/mean": 0.7904459238052368,
|
|
"sampling/importance_sampling_ratio/max": 0.9727844595909119,
|
|
"entropy": 0.3666645549237728,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.392410054802895,
|
|
"epoch": 0.004635416666666667,
|
|
"step": 178
|
|
},
|
|
{
|
|
"loss": -0.08780400454998016,
|
|
"grad_norm": 8.182136535644531,
|
|
"learning_rate": 4.206896551724138e-07,
|
|
"num_tokens": 1185599.0,
|
|
"completions/mean_length": 141.75,
|
|
"completions/min_length": 63.0,
|
|
"completions/max_length": 209.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 141.75,
|
|
"completions/min_terminated_length": 63.0,
|
|
"completions/max_terminated_length": 209.0,
|
|
"tools/call_frequency": 3.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.00987004954367876,
|
|
"sampling/sampling_logp_difference/max": 0.2421727180480957,
|
|
"sampling/importance_sampling_ratio/min": 0.3975090980529785,
|
|
"sampling/importance_sampling_ratio/mean": 1.002042293548584,
|
|
"sampling/importance_sampling_ratio/max": 1.966546893119812,
|
|
"entropy": 0.42018814384937286,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.668474476784468,
|
|
"epoch": 0.004661458333333333,
|
|
"step": 179
|
|
},
|
|
{
|
|
"loss": 0.6045021414756775,
|
|
"grad_norm": 15.846688270568848,
|
|
"learning_rate": 4.172413793103448e-07,
|
|
"num_tokens": 1191903.0,
|
|
"completions/mean_length": 102.5,
|
|
"completions/min_length": 70.0,
|
|
"completions/max_length": 219.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 102.5,
|
|
"completions/min_terminated_length": 70.0,
|
|
"completions/max_terminated_length": 219.0,
|
|
"tools/call_frequency": 2.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008791572414338589,
|
|
"sampling/sampling_logp_difference/max": 0.33843231201171875,
|
|
"sampling/importance_sampling_ratio/min": 0.6387788653373718,
|
|
"sampling/importance_sampling_ratio/mean": 1.055454969406128,
|
|
"sampling/importance_sampling_ratio/max": 1.326087474822998,
|
|
"entropy": 0.3026501890271902,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.579355504363775,
|
|
"epoch": 0.0046875,
|
|
"step": 180
|
|
},
|
|
{
|
|
"loss": 1.1409872770309448,
|
|
"grad_norm": 21.891529083251953,
|
|
"learning_rate": 4.1379310344827586e-07,
|
|
"num_tokens": 1198568.0,
|
|
"completions/mean_length": 147.25,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 293.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 147.25,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 293.0,
|
|
"tools/call_frequency": 2.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011778594925999641,
|
|
"sampling/sampling_logp_difference/max": 0.1832127571105957,
|
|
"sampling/importance_sampling_ratio/min": 0.7818493247032166,
|
|
"sampling/importance_sampling_ratio/mean": 1.3314809799194336,
|
|
"sampling/importance_sampling_ratio/max": 2.8407533168792725,
|
|
"entropy": 0.39793164283037186,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.6309323608875275,
|
|
"epoch": 0.004713541666666667,
|
|
"step": 181
|
|
},
|
|
{
|
|
"loss": 0.30127936601638794,
|
|
"grad_norm": 5.057689189910889,
|
|
"learning_rate": 4.103448275862069e-07,
|
|
"num_tokens": 1205479.0,
|
|
"completions/mean_length": 178.125,
|
|
"completions/min_length": 74.0,
|
|
"completions/max_length": 250.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 178.125,
|
|
"completions/min_terminated_length": 74.0,
|
|
"completions/max_terminated_length": 250.0,
|
|
"tools/call_frequency": 4.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03125,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.03125,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011917045339941978,
|
|
"sampling/sampling_logp_difference/max": 0.23945236206054688,
|
|
"sampling/importance_sampling_ratio/min": 0.6173256635665894,
|
|
"sampling/importance_sampling_ratio/mean": 0.9075149297714233,
|
|
"sampling/importance_sampling_ratio/max": 1.1264578104019165,
|
|
"entropy": 0.44140035286545753,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.923307754099369,
|
|
"epoch": 0.0047395833333333335,
|
|
"step": 182
|
|
},
|
|
{
|
|
"loss": 0.34322789311408997,
|
|
"grad_norm": 8.49929428100586,
|
|
"learning_rate": 4.068965517241379e-07,
|
|
"num_tokens": 1211849.0,
|
|
"completions/mean_length": 110.125,
|
|
"completions/min_length": 60.0,
|
|
"completions/max_length": 203.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 110.125,
|
|
"completions/min_terminated_length": 60.0,
|
|
"completions/max_terminated_length": 203.0,
|
|
"tools/call_frequency": 2.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010291483253240585,
|
|
"sampling/sampling_logp_difference/max": 0.24012541770935059,
|
|
"sampling/importance_sampling_ratio/min": 0.5971702933311462,
|
|
"sampling/importance_sampling_ratio/mean": 0.964635968208313,
|
|
"sampling/importance_sampling_ratio/max": 1.112904667854309,
|
|
"entropy": 0.391786839812994,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.570714749395847,
|
|
"epoch": 0.004765625,
|
|
"step": 183
|
|
},
|
|
{
|
|
"loss": 0.16904284060001373,
|
|
"grad_norm": 9.5955171585083,
|
|
"learning_rate": 4.034482758620689e-07,
|
|
"num_tokens": 1218678.0,
|
|
"completions/mean_length": 167.625,
|
|
"completions/min_length": 76.0,
|
|
"completions/max_length": 241.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 167.625,
|
|
"completions/min_terminated_length": 76.0,
|
|
"completions/max_terminated_length": 241.0,
|
|
"tools/call_frequency": 4.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012972831726074219,
|
|
"sampling/sampling_logp_difference/max": 0.24413681030273438,
|
|
"sampling/importance_sampling_ratio/min": 0.6339846849441528,
|
|
"sampling/importance_sampling_ratio/mean": 1.1767498254776,
|
|
"sampling/importance_sampling_ratio/max": 1.939034104347229,
|
|
"entropy": 0.39454277232289314,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.918307833373547,
|
|
"epoch": 0.004791666666666666,
|
|
"step": 184
|
|
},
|
|
{
|
|
"loss": -0.0006056800484657288,
|
|
"grad_norm": 12.325313568115234,
|
|
"learning_rate": 4e-07,
|
|
"num_tokens": 1224965.0,
|
|
"completions/mean_length": 99.875,
|
|
"completions/min_length": 33.0,
|
|
"completions/max_length": 275.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 99.875,
|
|
"completions/min_terminated_length": 33.0,
|
|
"completions/max_terminated_length": 275.0,
|
|
"tools/call_frequency": 1.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03375000134110451,
|
|
"rewards/reward_func/std": 0.023260941728949547,
|
|
"reward": 0.03375000134110451,
|
|
"reward_std": 0.023260943591594696,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012283585965633392,
|
|
"sampling/sampling_logp_difference/max": 0.4999208450317383,
|
|
"sampling/importance_sampling_ratio/min": 0.9127498269081116,
|
|
"sampling/importance_sampling_ratio/mean": 1.2342811822891235,
|
|
"sampling/importance_sampling_ratio/max": 1.8924020528793335,
|
|
"entropy": 0.39068141765892506,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.626852199435234,
|
|
"epoch": 0.0048177083333333336,
|
|
"step": 185
|
|
},
|
|
{
|
|
"loss": 0.07842296361923218,
|
|
"grad_norm": 6.335314750671387,
|
|
"learning_rate": 3.9655172413793105e-07,
|
|
"num_tokens": 1231534.0,
|
|
"completions/mean_length": 135.375,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 264.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 135.375,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 264.0,
|
|
"tools/call_frequency": 2.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012935163453221321,
|
|
"sampling/sampling_logp_difference/max": 0.20404204726219177,
|
|
"sampling/importance_sampling_ratio/min": 0.4006340503692627,
|
|
"sampling/importance_sampling_ratio/mean": 0.9868682622909546,
|
|
"sampling/importance_sampling_ratio/max": 1.386427402496338,
|
|
"entropy": 0.41527734510600567,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.903137322515249,
|
|
"epoch": 0.00484375,
|
|
"step": 186
|
|
},
|
|
{
|
|
"loss": 0.11629949510097504,
|
|
"grad_norm": 5.789632797241211,
|
|
"learning_rate": 3.9310344827586207e-07,
|
|
"num_tokens": 1238023.0,
|
|
"completions/mean_length": 125.75,
|
|
"completions/min_length": 75.0,
|
|
"completions/max_length": 250.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 125.75,
|
|
"completions/min_terminated_length": 75.0,
|
|
"completions/max_terminated_length": 250.0,
|
|
"tools/call_frequency": 2.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01072772592306137,
|
|
"sampling/sampling_logp_difference/max": 0.2597615718841553,
|
|
"sampling/importance_sampling_ratio/min": 0.339815616607666,
|
|
"sampling/importance_sampling_ratio/mean": 0.8379199504852295,
|
|
"sampling/importance_sampling_ratio/max": 1.291773796081543,
|
|
"entropy": 0.37690404057502747,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.60603829100728,
|
|
"epoch": 0.004869791666666666,
|
|
"step": 187
|
|
},
|
|
{
|
|
"loss": 0.3735130727291107,
|
|
"grad_norm": 10.981667518615723,
|
|
"learning_rate": 3.896551724137931e-07,
|
|
"num_tokens": 1244409.0,
|
|
"completions/mean_length": 112.125,
|
|
"completions/min_length": 66.0,
|
|
"completions/max_length": 228.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 112.125,
|
|
"completions/min_terminated_length": 66.0,
|
|
"completions/max_terminated_length": 228.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010385327972471714,
|
|
"sampling/sampling_logp_difference/max": 0.5025007724761963,
|
|
"sampling/importance_sampling_ratio/min": 0.4661784768104553,
|
|
"sampling/importance_sampling_ratio/mean": 0.9296875,
|
|
"sampling/importance_sampling_ratio/max": 1.2577831745147705,
|
|
"entropy": 0.355515418574214,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.957318779081106,
|
|
"epoch": 0.004895833333333334,
|
|
"step": 188
|
|
},
|
|
{
|
|
"loss": 0.21311049163341522,
|
|
"grad_norm": 6.727203369140625,
|
|
"learning_rate": 3.862068965517241e-07,
|
|
"num_tokens": 1251057.0,
|
|
"completions/mean_length": 145.25,
|
|
"completions/min_length": 74.0,
|
|
"completions/max_length": 263.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 145.25,
|
|
"completions/min_terminated_length": 74.0,
|
|
"completions/max_terminated_length": 263.0,
|
|
"tools/call_frequency": 2.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012884154915809631,
|
|
"sampling/sampling_logp_difference/max": 0.38040757179260254,
|
|
"sampling/importance_sampling_ratio/min": 0.5787162184715271,
|
|
"sampling/importance_sampling_ratio/mean": 0.8488845825195312,
|
|
"sampling/importance_sampling_ratio/max": 1.2245104312896729,
|
|
"entropy": 0.42780186235904694,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.5089960135519505,
|
|
"epoch": 0.004921875,
|
|
"step": 189
|
|
},
|
|
{
|
|
"loss": 0.6590151190757751,
|
|
"grad_norm": 14.280123710632324,
|
|
"learning_rate": 3.827586206896551e-07,
|
|
"num_tokens": 1257511.0,
|
|
"completions/mean_length": 120.0,
|
|
"completions/min_length": 77.0,
|
|
"completions/max_length": 236.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 120.0,
|
|
"completions/min_terminated_length": 77.0,
|
|
"completions/max_terminated_length": 236.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011502846144139767,
|
|
"sampling/sampling_logp_difference/max": 0.30818653106689453,
|
|
"sampling/importance_sampling_ratio/min": 0.5623441934585571,
|
|
"sampling/importance_sampling_ratio/mean": 0.9922210574150085,
|
|
"sampling/importance_sampling_ratio/max": 1.4878226518630981,
|
|
"entropy": 0.3852516859769821,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.386795286089182,
|
|
"epoch": 0.0049479166666666664,
|
|
"step": 190
|
|
},
|
|
{
|
|
"loss": 0.38144803047180176,
|
|
"grad_norm": 10.913237571716309,
|
|
"learning_rate": 3.793103448275862e-07,
|
|
"num_tokens": 1264237.0,
|
|
"completions/mean_length": 155.5,
|
|
"completions/min_length": 85.0,
|
|
"completions/max_length": 260.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 155.5,
|
|
"completions/min_terminated_length": 85.0,
|
|
"completions/max_terminated_length": 260.0,
|
|
"tools/call_frequency": 3.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012909011915326118,
|
|
"sampling/sampling_logp_difference/max": 0.2953941822052002,
|
|
"sampling/importance_sampling_ratio/min": 0.461484432220459,
|
|
"sampling/importance_sampling_ratio/mean": 1.0771204233169556,
|
|
"sampling/importance_sampling_ratio/max": 1.5659905672073364,
|
|
"entropy": 0.44374576583504677,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.805965360254049,
|
|
"epoch": 0.004973958333333334,
|
|
"step": 191
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 3.758620689655172e-07,
|
|
"num_tokens": 1270399.0,
|
|
"completions/mean_length": 83.875,
|
|
"completions/min_length": 72.0,
|
|
"completions/max_length": 117.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 83.875,
|
|
"completions/min_terminated_length": 72.0,
|
|
"completions/max_terminated_length": 117.0,
|
|
"tools/call_frequency": 1.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011835743673145771,
|
|
"sampling/sampling_logp_difference/max": 0.2230854034423828,
|
|
"sampling/importance_sampling_ratio/min": 0.45591768622398376,
|
|
"sampling/importance_sampling_ratio/mean": 0.8939676880836487,
|
|
"sampling/importance_sampling_ratio/max": 1.3621009588241577,
|
|
"entropy": 0.38288533315062523,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 3.9766218550503254,
|
|
"epoch": 0.005,
|
|
"step": 192
|
|
},
|
|
{
|
|
"loss": 0.056972865015268326,
|
|
"grad_norm": 5.35400915145874,
|
|
"learning_rate": 3.7241379310344827e-07,
|
|
"num_tokens": 1276976.0,
|
|
"completions/mean_length": 136.625,
|
|
"completions/min_length": 77.0,
|
|
"completions/max_length": 275.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 136.625,
|
|
"completions/min_terminated_length": 77.0,
|
|
"completions/max_terminated_length": 275.0,
|
|
"tools/call_frequency": 2.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011981626972556114,
|
|
"sampling/sampling_logp_difference/max": 0.244032621383667,
|
|
"sampling/importance_sampling_ratio/min": 0.44053128361701965,
|
|
"sampling/importance_sampling_ratio/mean": 0.7978172898292542,
|
|
"sampling/importance_sampling_ratio/max": 1.0736907720565796,
|
|
"entropy": 0.4474455751478672,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.814843371510506,
|
|
"epoch": 0.0050260416666666665,
|
|
"step": 193
|
|
},
|
|
{
|
|
"loss": 0.016485296189785004,
|
|
"grad_norm": 7.252522945404053,
|
|
"learning_rate": 3.689655172413793e-07,
|
|
"num_tokens": 1283648.0,
|
|
"completions/mean_length": 148.125,
|
|
"completions/min_length": 70.0,
|
|
"completions/max_length": 260.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 148.125,
|
|
"completions/min_terminated_length": 70.0,
|
|
"completions/max_terminated_length": 260.0,
|
|
"tools/call_frequency": 3.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012578821741044521,
|
|
"sampling/sampling_logp_difference/max": 0.23240303993225098,
|
|
"sampling/importance_sampling_ratio/min": 0.8274345993995667,
|
|
"sampling/importance_sampling_ratio/mean": 1.1455323696136475,
|
|
"sampling/importance_sampling_ratio/max": 1.6724406480789185,
|
|
"entropy": 0.4318423978984356,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.095242727547884,
|
|
"epoch": 0.005052083333333333,
|
|
"step": 194
|
|
},
|
|
{
|
|
"loss": 0.6880623698234558,
|
|
"grad_norm": 16.694412231445312,
|
|
"learning_rate": 3.6551724137931036e-07,
|
|
"num_tokens": 1290314.0,
|
|
"completions/mean_length": 147.25,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 238.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 147.25,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 238.0,
|
|
"tools/call_frequency": 3.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012899965047836304,
|
|
"sampling/sampling_logp_difference/max": 0.3462080955505371,
|
|
"sampling/importance_sampling_ratio/min": 0.4847384989261627,
|
|
"sampling/importance_sampling_ratio/mean": 1.084380865097046,
|
|
"sampling/importance_sampling_ratio/max": 1.9770784378051758,
|
|
"entropy": 0.4202742390334606,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.784683238714933,
|
|
"epoch": 0.005078125,
|
|
"step": 195
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 3.620689655172414e-07,
|
|
"num_tokens": 1296967.0,
|
|
"completions/mean_length": 145.875,
|
|
"completions/min_length": 78.0,
|
|
"completions/max_length": 285.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 145.875,
|
|
"completions/min_terminated_length": 78.0,
|
|
"completions/max_terminated_length": 285.0,
|
|
"tools/call_frequency": 2.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012529930099844933,
|
|
"sampling/sampling_logp_difference/max": 0.24443650245666504,
|
|
"sampling/importance_sampling_ratio/min": 0.5624415874481201,
|
|
"sampling/importance_sampling_ratio/mean": 0.8213838338851929,
|
|
"sampling/importance_sampling_ratio/max": 1.0986772775650024,
|
|
"entropy": 0.42567526921629906,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.492628771811724,
|
|
"epoch": 0.005104166666666667,
|
|
"step": 196
|
|
},
|
|
{
|
|
"loss": 0.45965296030044556,
|
|
"grad_norm": 8.655374526977539,
|
|
"learning_rate": 3.586206896551724e-07,
|
|
"num_tokens": 1303611.0,
|
|
"completions/mean_length": 144.25,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 267.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 144.25,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 267.0,
|
|
"tools/call_frequency": 3.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011928001418709755,
|
|
"sampling/sampling_logp_difference/max": 0.22033953666687012,
|
|
"sampling/importance_sampling_ratio/min": 0.5027190446853638,
|
|
"sampling/importance_sampling_ratio/mean": 0.8887758851051331,
|
|
"sampling/importance_sampling_ratio/max": 1.3258726596832275,
|
|
"entropy": 0.46588760428130627,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.284952130168676,
|
|
"epoch": 0.005130208333333333,
|
|
"step": 197
|
|
},
|
|
{
|
|
"loss": 0.18497925996780396,
|
|
"grad_norm": 7.559632301330566,
|
|
"learning_rate": 3.551724137931034e-07,
|
|
"num_tokens": 1310215.0,
|
|
"completions/mean_length": 139.625,
|
|
"completions/min_length": 70.0,
|
|
"completions/max_length": 247.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 139.625,
|
|
"completions/min_terminated_length": 70.0,
|
|
"completions/max_terminated_length": 247.0,
|
|
"tools/call_frequency": 2.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012348986230790615,
|
|
"sampling/sampling_logp_difference/max": 0.27898216247558594,
|
|
"sampling/importance_sampling_ratio/min": 0.5253216624259949,
|
|
"sampling/importance_sampling_ratio/mean": 0.7854946255683899,
|
|
"sampling/importance_sampling_ratio/max": 0.8735929131507874,
|
|
"entropy": 0.45491900481283665,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.465506013482809,
|
|
"epoch": 0.00515625,
|
|
"step": 198
|
|
},
|
|
{
|
|
"loss": -0.08935487270355225,
|
|
"grad_norm": 6.127851486206055,
|
|
"learning_rate": 3.517241379310344e-07,
|
|
"num_tokens": 1316936.0,
|
|
"completions/mean_length": 153.875,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 247.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 153.875,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 247.0,
|
|
"tools/call_frequency": 3.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012517875991761684,
|
|
"sampling/sampling_logp_difference/max": 0.24907398223876953,
|
|
"sampling/importance_sampling_ratio/min": 0.4286423623561859,
|
|
"sampling/importance_sampling_ratio/mean": 0.9874168038368225,
|
|
"sampling/importance_sampling_ratio/max": 2.276364326477051,
|
|
"entropy": 0.44687318429350853,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.690568562597036,
|
|
"epoch": 0.005182291666666667,
|
|
"step": 199
|
|
},
|
|
{
|
|
"loss": 0.9141201972961426,
|
|
"grad_norm": 16.405120849609375,
|
|
"learning_rate": 3.482758620689655e-07,
|
|
"num_tokens": 1323391.0,
|
|
"completions/mean_length": 121.625,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 251.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 121.625,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 251.0,
|
|
"tools/call_frequency": 2.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012842261232435703,
|
|
"sampling/sampling_logp_difference/max": 0.2057645320892334,
|
|
"sampling/importance_sampling_ratio/min": 0.46204623579978943,
|
|
"sampling/importance_sampling_ratio/mean": 0.9734433889389038,
|
|
"sampling/importance_sampling_ratio/max": 1.8341413736343384,
|
|
"entropy": 0.3637054245918989,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.475969448685646,
|
|
"epoch": 0.005208333333333333,
|
|
"step": 200
|
|
},
|
|
{
|
|
"loss": 0.9453942775726318,
|
|
"grad_norm": 17.104549407958984,
|
|
"learning_rate": 3.4482758620689656e-07,
|
|
"num_tokens": 1329885.0,
|
|
"completions/mean_length": 125.5,
|
|
"completions/min_length": 70.0,
|
|
"completions/max_length": 237.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 125.5,
|
|
"completions/min_terminated_length": 70.0,
|
|
"completions/max_terminated_length": 237.0,
|
|
"tools/call_frequency": 2.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01111309602856636,
|
|
"sampling/sampling_logp_difference/max": 0.30436182022094727,
|
|
"sampling/importance_sampling_ratio/min": 0.9285438656806946,
|
|
"sampling/importance_sampling_ratio/mean": 1.2504147291183472,
|
|
"sampling/importance_sampling_ratio/max": 2.410783052444458,
|
|
"entropy": 0.3642578963190317,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.403528522700071,
|
|
"epoch": 0.005234375,
|
|
"step": 201
|
|
},
|
|
{
|
|
"loss": 0.21054492890834808,
|
|
"grad_norm": 9.34546184539795,
|
|
"learning_rate": 3.413793103448276e-07,
|
|
"num_tokens": 1336420.0,
|
|
"completions/mean_length": 130.5,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 298.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 130.5,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 298.0,
|
|
"tools/call_frequency": 2.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011648633517324924,
|
|
"sampling/sampling_logp_difference/max": 0.23357868194580078,
|
|
"sampling/importance_sampling_ratio/min": 0.24158550798892975,
|
|
"sampling/importance_sampling_ratio/mean": 1.0925474166870117,
|
|
"sampling/importance_sampling_ratio/max": 2.336683511734009,
|
|
"entropy": 0.4032603092491627,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.478457719087601,
|
|
"epoch": 0.005260416666666667,
|
|
"step": 202
|
|
},
|
|
{
|
|
"loss": 0.279621958732605,
|
|
"grad_norm": 9.959053993225098,
|
|
"learning_rate": 3.379310344827586e-07,
|
|
"num_tokens": 1343049.0,
|
|
"completions/mean_length": 142.5,
|
|
"completions/min_length": 74.0,
|
|
"completions/max_length": 242.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 142.5,
|
|
"completions/min_terminated_length": 74.0,
|
|
"completions/max_terminated_length": 242.0,
|
|
"tools/call_frequency": 3.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011681344360113144,
|
|
"sampling/sampling_logp_difference/max": 0.21847867965698242,
|
|
"sampling/importance_sampling_ratio/min": 0.6201596856117249,
|
|
"sampling/importance_sampling_ratio/mean": 1.168886661529541,
|
|
"sampling/importance_sampling_ratio/max": 2.254486083984375,
|
|
"entropy": 0.3999029342085123,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.769645597785711,
|
|
"epoch": 0.005286458333333333,
|
|
"step": 203
|
|
},
|
|
{
|
|
"loss": -0.11037106812000275,
|
|
"grad_norm": 5.849955081939697,
|
|
"learning_rate": 3.3448275862068966e-07,
|
|
"num_tokens": 1349865.0,
|
|
"completions/mean_length": 166.0,
|
|
"completions/min_length": 78.0,
|
|
"completions/max_length": 277.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 166.0,
|
|
"completions/min_terminated_length": 78.0,
|
|
"completions/max_terminated_length": 277.0,
|
|
"tools/call_frequency": 3.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526474453508854,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012746571563184261,
|
|
"sampling/sampling_logp_difference/max": 0.24169301986694336,
|
|
"sampling/importance_sampling_ratio/min": 0.32824668288230896,
|
|
"sampling/importance_sampling_ratio/mean": 0.8333212733268738,
|
|
"sampling/importance_sampling_ratio/max": 1.310794472694397,
|
|
"entropy": 0.498266514390707,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.253634586930275,
|
|
"epoch": 0.0053125,
|
|
"step": 204
|
|
},
|
|
{
|
|
"loss": 0.3719358742237091,
|
|
"grad_norm": 11.291912078857422,
|
|
"learning_rate": 3.310344827586207e-07,
|
|
"num_tokens": 1356449.0,
|
|
"completions/mean_length": 137.0,
|
|
"completions/min_length": 72.0,
|
|
"completions/max_length": 283.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 137.0,
|
|
"completions/min_terminated_length": 72.0,
|
|
"completions/max_terminated_length": 283.0,
|
|
"tools/call_frequency": 2.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01213235966861248,
|
|
"sampling/sampling_logp_difference/max": 0.2695298194885254,
|
|
"sampling/importance_sampling_ratio/min": 0.3053126335144043,
|
|
"sampling/importance_sampling_ratio/mean": 0.8756632208824158,
|
|
"sampling/importance_sampling_ratio/max": 1.4020564556121826,
|
|
"entropy": 0.40571884252130985,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.380243666470051,
|
|
"epoch": 0.005338541666666667,
|
|
"step": 205
|
|
},
|
|
{
|
|
"loss": 0.13082677125930786,
|
|
"grad_norm": 6.490048408508301,
|
|
"learning_rate": 3.275862068965517e-07,
|
|
"num_tokens": 1362935.0,
|
|
"completions/mean_length": 123.125,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 223.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 123.125,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 223.0,
|
|
"tools/call_frequency": 2.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01020714733749628,
|
|
"sampling/sampling_logp_difference/max": 0.2975800037384033,
|
|
"sampling/importance_sampling_ratio/min": 0.7269694805145264,
|
|
"sampling/importance_sampling_ratio/mean": 0.9220360517501831,
|
|
"sampling/importance_sampling_ratio/max": 1.108488917350769,
|
|
"entropy": 0.3558282647281885,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.2529863603413105,
|
|
"epoch": 0.005364583333333333,
|
|
"step": 206
|
|
},
|
|
{
|
|
"loss": 0.7816362380981445,
|
|
"grad_norm": 17.64269256591797,
|
|
"learning_rate": 3.241379310344827e-07,
|
|
"num_tokens": 1369267.0,
|
|
"completions/mean_length": 105.75,
|
|
"completions/min_length": 70.0,
|
|
"completions/max_length": 223.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 105.75,
|
|
"completions/min_terminated_length": 70.0,
|
|
"completions/max_terminated_length": 223.0,
|
|
"tools/call_frequency": 2.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011245619505643845,
|
|
"sampling/sampling_logp_difference/max": 0.21663975715637207,
|
|
"sampling/importance_sampling_ratio/min": 0.9651802182197571,
|
|
"sampling/importance_sampling_ratio/mean": 1.3807144165039062,
|
|
"sampling/importance_sampling_ratio/max": 2.6575331687927246,
|
|
"entropy": 0.3583196084946394,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.310196924954653,
|
|
"epoch": 0.005390625,
|
|
"step": 207
|
|
},
|
|
{
|
|
"loss": 0.40571242570877075,
|
|
"grad_norm": 12.48848819732666,
|
|
"learning_rate": 3.2068965517241373e-07,
|
|
"num_tokens": 1375565.0,
|
|
"completions/mean_length": 101.625,
|
|
"completions/min_length": 66.0,
|
|
"completions/max_length": 239.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 101.625,
|
|
"completions/min_terminated_length": 66.0,
|
|
"completions/max_terminated_length": 239.0,
|
|
"tools/call_frequency": 1.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009595691226422787,
|
|
"sampling/sampling_logp_difference/max": 0.3749361038208008,
|
|
"sampling/importance_sampling_ratio/min": 0.8002716302871704,
|
|
"sampling/importance_sampling_ratio/mean": 0.9763150215148926,
|
|
"sampling/importance_sampling_ratio/max": 1.2989428043365479,
|
|
"entropy": 0.32817674800753593,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.5159632712602615,
|
|
"epoch": 0.005416666666666667,
|
|
"step": 208
|
|
},
|
|
{
|
|
"loss": 0.5767332911491394,
|
|
"grad_norm": 11.465566635131836,
|
|
"learning_rate": 3.1724137931034485e-07,
|
|
"num_tokens": 1382229.0,
|
|
"completions/mean_length": 146.75,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 265.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 146.75,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 265.0,
|
|
"tools/call_frequency": 3.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011839838698506355,
|
|
"sampling/sampling_logp_difference/max": 0.5961899757385254,
|
|
"sampling/importance_sampling_ratio/min": 0.5625261664390564,
|
|
"sampling/importance_sampling_ratio/mean": 1.1063092947006226,
|
|
"sampling/importance_sampling_ratio/max": 1.7667672634124756,
|
|
"entropy": 0.4060604628175497,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.446445610374212,
|
|
"epoch": 0.005442708333333333,
|
|
"step": 209
|
|
},
|
|
{
|
|
"loss": -0.23488286137580872,
|
|
"grad_norm": 2.3821659088134766,
|
|
"learning_rate": 3.1379310344827587e-07,
|
|
"num_tokens": 1388637.0,
|
|
"completions/mean_length": 115.25,
|
|
"completions/min_length": 72.0,
|
|
"completions/max_length": 251.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 115.25,
|
|
"completions/min_terminated_length": 72.0,
|
|
"completions/max_terminated_length": 251.0,
|
|
"tools/call_frequency": 2.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012368322350084782,
|
|
"sampling/sampling_logp_difference/max": 0.2108621597290039,
|
|
"sampling/importance_sampling_ratio/min": 0.0,
|
|
"sampling/importance_sampling_ratio/mean": 0.8220264315605164,
|
|
"sampling/importance_sampling_ratio/max": 1.2257623672485352,
|
|
"entropy": 0.39095643907785416,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.334742747247219,
|
|
"epoch": 0.00546875,
|
|
"step": 210
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 3.103448275862069e-07,
|
|
"num_tokens": 1395151.0,
|
|
"completions/mean_length": 128.875,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 308.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 128.875,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 308.0,
|
|
"tools/call_frequency": 2.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012848781421780586,
|
|
"sampling/sampling_logp_difference/max": 0.33110857009887695,
|
|
"sampling/importance_sampling_ratio/min": 0.6424484848976135,
|
|
"sampling/importance_sampling_ratio/mean": 1.02729332447052,
|
|
"sampling/importance_sampling_ratio/max": 2.2100915908813477,
|
|
"entropy": 0.3777618892490864,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.429770581424236,
|
|
"epoch": 0.005494791666666667,
|
|
"step": 211
|
|
},
|
|
{
|
|
"loss": 0.15680256485939026,
|
|
"grad_norm": 11.032898902893066,
|
|
"learning_rate": 3.068965517241379e-07,
|
|
"num_tokens": 1402050.0,
|
|
"completions/mean_length": 176.75,
|
|
"completions/min_length": 93.0,
|
|
"completions/max_length": 285.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 176.75,
|
|
"completions/min_terminated_length": 93.0,
|
|
"completions/max_terminated_length": 285.0,
|
|
"tools/call_frequency": 3.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013004615902900696,
|
|
"sampling/sampling_logp_difference/max": 0.23497986793518066,
|
|
"sampling/importance_sampling_ratio/min": 0.694526731967926,
|
|
"sampling/importance_sampling_ratio/mean": 1.2747150659561157,
|
|
"sampling/importance_sampling_ratio/max": 2.4309091567993164,
|
|
"entropy": 0.4759202115237713,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.89239677041769,
|
|
"epoch": 0.005520833333333333,
|
|
"step": 212
|
|
},
|
|
{
|
|
"loss": 0.3323233723640442,
|
|
"grad_norm": 7.215777397155762,
|
|
"learning_rate": 3.0344827586206897e-07,
|
|
"num_tokens": 1409168.0,
|
|
"completions/mean_length": 204.125,
|
|
"completions/min_length": 77.0,
|
|
"completions/max_length": 297.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 204.125,
|
|
"completions/min_terminated_length": 77.0,
|
|
"completions/max_terminated_length": 297.0,
|
|
"tools/call_frequency": 4.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.016089437529444695,
|
|
"sampling/sampling_logp_difference/max": 0.28532445430755615,
|
|
"sampling/importance_sampling_ratio/min": 0.7036678791046143,
|
|
"sampling/importance_sampling_ratio/mean": 1.0391933917999268,
|
|
"sampling/importance_sampling_ratio/max": 1.47321355342865,
|
|
"entropy": 0.5410622581839561,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.559695336967707,
|
|
"epoch": 0.005546875,
|
|
"step": 213
|
|
},
|
|
{
|
|
"loss": 0.23397217690944672,
|
|
"grad_norm": 5.875241756439209,
|
|
"learning_rate": 3e-07,
|
|
"num_tokens": 1415976.0,
|
|
"completions/mean_length": 165.375,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 258.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 165.375,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 258.0,
|
|
"tools/call_frequency": 3.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011345112696290016,
|
|
"sampling/sampling_logp_difference/max": 0.1864471435546875,
|
|
"sampling/importance_sampling_ratio/min": 0.4188888370990753,
|
|
"sampling/importance_sampling_ratio/mean": 0.9156566858291626,
|
|
"sampling/importance_sampling_ratio/max": 1.3792855739593506,
|
|
"entropy": 0.4403095841407776,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.581337206065655,
|
|
"epoch": 0.005572916666666667,
|
|
"step": 214
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 2.96551724137931e-07,
|
|
"num_tokens": 1422231.0,
|
|
"completions/mean_length": 95.875,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 213.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 95.875,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 213.0,
|
|
"tools/call_frequency": 1.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010533266700804234,
|
|
"sampling/sampling_logp_difference/max": 0.25306034088134766,
|
|
"sampling/importance_sampling_ratio/min": 0.5759313106536865,
|
|
"sampling/importance_sampling_ratio/mean": 0.8588753938674927,
|
|
"sampling/importance_sampling_ratio/max": 1.0917410850524902,
|
|
"entropy": 0.3255910091102123,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.091893520206213,
|
|
"epoch": 0.005598958333333333,
|
|
"step": 215
|
|
},
|
|
{
|
|
"loss": 0.32778310775756836,
|
|
"grad_norm": 10.576912879943848,
|
|
"learning_rate": 2.93103448275862e-07,
|
|
"num_tokens": 1428644.0,
|
|
"completions/mean_length": 115.5,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 237.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 115.5,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 237.0,
|
|
"tools/call_frequency": 2.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01138492301106453,
|
|
"sampling/sampling_logp_difference/max": 0.24492597579956055,
|
|
"sampling/importance_sampling_ratio/min": 0.524755597114563,
|
|
"sampling/importance_sampling_ratio/mean": 0.9320729374885559,
|
|
"sampling/importance_sampling_ratio/max": 1.35755455493927,
|
|
"entropy": 0.37721105106174946,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.260284721851349,
|
|
"epoch": 0.005625,
|
|
"step": 216
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 2.896551724137931e-07,
|
|
"num_tokens": 1435057.0,
|
|
"completions/mean_length": 116.125,
|
|
"completions/min_length": 65.0,
|
|
"completions/max_length": 251.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 116.125,
|
|
"completions/min_terminated_length": 65.0,
|
|
"completions/max_terminated_length": 251.0,
|
|
"tools/call_frequency": 1.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012136752717196941,
|
|
"sampling/sampling_logp_difference/max": 0.23023200035095215,
|
|
"sampling/importance_sampling_ratio/min": 0.40735483169555664,
|
|
"sampling/importance_sampling_ratio/mean": 0.9149947166442871,
|
|
"sampling/importance_sampling_ratio/max": 1.4666075706481934,
|
|
"entropy": 0.4278120342642069,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.436994034796953,
|
|
"epoch": 0.005651041666666667,
|
|
"step": 217
|
|
},
|
|
{
|
|
"loss": 0.06301713734865189,
|
|
"grad_norm": 8.017706871032715,
|
|
"learning_rate": 2.8620689655172416e-07,
|
|
"num_tokens": 1441547.0,
|
|
"completions/mean_length": 124.625,
|
|
"completions/min_length": 73.0,
|
|
"completions/max_length": 279.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 124.625,
|
|
"completions/min_terminated_length": 73.0,
|
|
"completions/max_terminated_length": 279.0,
|
|
"tools/call_frequency": 2.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013832253403961658,
|
|
"sampling/sampling_logp_difference/max": 0.32451510429382324,
|
|
"sampling/importance_sampling_ratio/min": 0.5127649903297424,
|
|
"sampling/importance_sampling_ratio/mean": 1.092328429222107,
|
|
"sampling/importance_sampling_ratio/max": 1.518818974494934,
|
|
"entropy": 0.43027937039732933,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.3908355087041855,
|
|
"epoch": 0.0056770833333333335,
|
|
"step": 218
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 2.827586206896552e-07,
|
|
"num_tokens": 1448105.0,
|
|
"completions/mean_length": 133.875,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 221.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 133.875,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 221.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01342255063354969,
|
|
"sampling/sampling_logp_difference/max": 0.27190732955932617,
|
|
"sampling/importance_sampling_ratio/min": 0.7653844952583313,
|
|
"sampling/importance_sampling_ratio/mean": 1.0253962278366089,
|
|
"sampling/importance_sampling_ratio/max": 1.3865551948547363,
|
|
"entropy": 0.45285717211663723,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.378151454031467,
|
|
"epoch": 0.005703125,
|
|
"step": 219
|
|
},
|
|
{
|
|
"loss": 0.5095319747924805,
|
|
"grad_norm": 11.815544128417969,
|
|
"learning_rate": 2.793103448275862e-07,
|
|
"num_tokens": 1454882.0,
|
|
"completions/mean_length": 161.25,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 313.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 161.25,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 313.0,
|
|
"tools/call_frequency": 3.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.014361303299665451,
|
|
"sampling/sampling_logp_difference/max": 0.3563472032546997,
|
|
"sampling/importance_sampling_ratio/min": 0.3937526047229767,
|
|
"sampling/importance_sampling_ratio/mean": 0.906612753868103,
|
|
"sampling/importance_sampling_ratio/max": 1.582302451133728,
|
|
"entropy": 0.4475947581231594,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.597413223236799,
|
|
"epoch": 0.005729166666666666,
|
|
"step": 220
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 2.758620689655172e-07,
|
|
"num_tokens": 1461490.0,
|
|
"completions/mean_length": 139.875,
|
|
"completions/min_length": 80.0,
|
|
"completions/max_length": 254.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 139.875,
|
|
"completions/min_terminated_length": 80.0,
|
|
"completions/max_terminated_length": 254.0,
|
|
"tools/call_frequency": 2.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012968702241778374,
|
|
"sampling/sampling_logp_difference/max": 0.38468262553215027,
|
|
"sampling/importance_sampling_ratio/min": 0.36424314975738525,
|
|
"sampling/importance_sampling_ratio/mean": 0.691200852394104,
|
|
"sampling/importance_sampling_ratio/max": 1.1632012128829956,
|
|
"entropy": 0.4124142676591873,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.133171293884516,
|
|
"epoch": 0.0057552083333333335,
|
|
"step": 221
|
|
},
|
|
{
|
|
"loss": 0.19329620897769928,
|
|
"grad_norm": 6.358828544616699,
|
|
"learning_rate": 2.724137931034483e-07,
|
|
"num_tokens": 1468411.0,
|
|
"completions/mean_length": 179.25,
|
|
"completions/min_length": 86.0,
|
|
"completions/max_length": 261.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 179.25,
|
|
"completions/min_terminated_length": 86.0,
|
|
"completions/max_terminated_length": 261.0,
|
|
"tools/call_frequency": 3.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01195982750505209,
|
|
"sampling/sampling_logp_difference/max": 0.21186542510986328,
|
|
"sampling/importance_sampling_ratio/min": 0.6114763617515564,
|
|
"sampling/importance_sampling_ratio/mean": 0.8549631834030151,
|
|
"sampling/importance_sampling_ratio/max": 1.1557800769805908,
|
|
"entropy": 0.4751623086631298,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.601303726434708,
|
|
"epoch": 0.00578125,
|
|
"step": 222
|
|
},
|
|
{
|
|
"loss": 0.597856342792511,
|
|
"grad_norm": 11.19804859161377,
|
|
"learning_rate": 2.689655172413793e-07,
|
|
"num_tokens": 1475019.0,
|
|
"completions/mean_length": 140.125,
|
|
"completions/min_length": 77.0,
|
|
"completions/max_length": 251.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 140.125,
|
|
"completions/min_terminated_length": 77.0,
|
|
"completions/max_terminated_length": 251.0,
|
|
"tools/call_frequency": 2.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.014490770176053047,
|
|
"sampling/sampling_logp_difference/max": 0.4966411590576172,
|
|
"sampling/importance_sampling_ratio/min": 0.2947727143764496,
|
|
"sampling/importance_sampling_ratio/mean": 0.9278420209884644,
|
|
"sampling/importance_sampling_ratio/max": 1.7858716249465942,
|
|
"entropy": 0.4526561126112938,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.656230702996254,
|
|
"epoch": 0.005807291666666666,
|
|
"step": 223
|
|
},
|
|
{
|
|
"loss": 0.5293675661087036,
|
|
"grad_norm": 10.959287643432617,
|
|
"learning_rate": 2.655172413793103e-07,
|
|
"num_tokens": 1482018.0,
|
|
"completions/mean_length": 188.875,
|
|
"completions/min_length": 88.0,
|
|
"completions/max_length": 308.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 188.875,
|
|
"completions/min_terminated_length": 88.0,
|
|
"completions/max_terminated_length": 308.0,
|
|
"tools/call_frequency": 3.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.015520632266998291,
|
|
"sampling/sampling_logp_difference/max": 0.4545530080795288,
|
|
"sampling/importance_sampling_ratio/min": 0.26863721013069153,
|
|
"sampling/importance_sampling_ratio/mean": 1.010183334350586,
|
|
"sampling/importance_sampling_ratio/max": 2.2065470218658447,
|
|
"entropy": 0.5238443687558174,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.02837996929884,
|
|
"epoch": 0.005833333333333334,
|
|
"step": 224
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 2.620689655172414e-07,
|
|
"num_tokens": 1488407.0,
|
|
"completions/mean_length": 113.375,
|
|
"completions/min_length": 72.0,
|
|
"completions/max_length": 274.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 113.375,
|
|
"completions/min_terminated_length": 72.0,
|
|
"completions/max_terminated_length": 274.0,
|
|
"tools/call_frequency": 1.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011422202922403812,
|
|
"sampling/sampling_logp_difference/max": 0.18252670764923096,
|
|
"sampling/importance_sampling_ratio/min": 0.781724750995636,
|
|
"sampling/importance_sampling_ratio/mean": 1.1000239849090576,
|
|
"sampling/importance_sampling_ratio/max": 1.876916527748108,
|
|
"entropy": 0.3653805945068598,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.194482043385506,
|
|
"epoch": 0.005859375,
|
|
"step": 225
|
|
},
|
|
{
|
|
"loss": 0.3485426902770996,
|
|
"grad_norm": 7.607486248016357,
|
|
"learning_rate": 2.586206896551724e-07,
|
|
"num_tokens": 1494959.0,
|
|
"completions/mean_length": 133.375,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 279.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 133.375,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 279.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011195224709808826,
|
|
"sampling/sampling_logp_difference/max": 0.35314178466796875,
|
|
"sampling/importance_sampling_ratio/min": 0.5968507528305054,
|
|
"sampling/importance_sampling_ratio/mean": 0.9407460689544678,
|
|
"sampling/importance_sampling_ratio/max": 1.2945661544799805,
|
|
"entropy": 0.4079206567257643,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.4857202507555485,
|
|
"epoch": 0.005885416666666666,
|
|
"step": 226
|
|
},
|
|
{
|
|
"loss": -0.20471936464309692,
|
|
"grad_norm": 5.693267345428467,
|
|
"learning_rate": 2.5517241379310346e-07,
|
|
"num_tokens": 1501562.0,
|
|
"completions/mean_length": 139.375,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 247.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 139.375,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 247.0,
|
|
"tools/call_frequency": 2.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013582213781774044,
|
|
"sampling/sampling_logp_difference/max": 0.4022789001464844,
|
|
"sampling/importance_sampling_ratio/min": 0.4726339876651764,
|
|
"sampling/importance_sampling_ratio/mean": 1.0938546657562256,
|
|
"sampling/importance_sampling_ratio/max": 2.6664717197418213,
|
|
"entropy": 0.47337841987609863,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.482229553163052,
|
|
"epoch": 0.005911458333333334,
|
|
"step": 227
|
|
},
|
|
{
|
|
"loss": 0.33710193634033203,
|
|
"grad_norm": 11.913230895996094,
|
|
"learning_rate": 2.517241379310345e-07,
|
|
"num_tokens": 1507937.0,
|
|
"completions/mean_length": 110.875,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 209.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 110.875,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 209.0,
|
|
"tools/call_frequency": 2.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011915264651179314,
|
|
"sampling/sampling_logp_difference/max": 0.32894766330718994,
|
|
"sampling/importance_sampling_ratio/min": 0.5162224769592285,
|
|
"sampling/importance_sampling_ratio/mean": 0.9611517190933228,
|
|
"sampling/importance_sampling_ratio/max": 1.1616952419281006,
|
|
"entropy": 0.3980562053620815,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.100301347672939,
|
|
"epoch": 0.0059375,
|
|
"step": 228
|
|
},
|
|
{
|
|
"loss": 0.5788843035697937,
|
|
"grad_norm": 11.747881889343262,
|
|
"learning_rate": 2.482758620689655e-07,
|
|
"num_tokens": 1514313.0,
|
|
"completions/mean_length": 111.0,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 217.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 111.0,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 217.0,
|
|
"tools/call_frequency": 2.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008764228783547878,
|
|
"sampling/sampling_logp_difference/max": 0.22508716583251953,
|
|
"sampling/importance_sampling_ratio/min": 0.7427531480789185,
|
|
"sampling/importance_sampling_ratio/mean": 1.0354865789413452,
|
|
"sampling/importance_sampling_ratio/max": 1.3873703479766846,
|
|
"entropy": 0.30576622672379017,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.509747326374054,
|
|
"epoch": 0.0059635416666666665,
|
|
"step": 229
|
|
},
|
|
{
|
|
"loss": 0.04729544371366501,
|
|
"grad_norm": 5.205223560333252,
|
|
"learning_rate": 2.448275862068965e-07,
|
|
"num_tokens": 1520761.0,
|
|
"completions/mean_length": 121.0,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 223.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 121.0,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 223.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.008530820719897747,
|
|
"sampling/sampling_logp_difference/max": 0.2261028289794922,
|
|
"sampling/importance_sampling_ratio/min": 0.5309289693832397,
|
|
"sampling/importance_sampling_ratio/mean": 0.8819470405578613,
|
|
"sampling/importance_sampling_ratio/max": 1.2538028955459595,
|
|
"entropy": 0.3017638046294451,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.279969118535519,
|
|
"epoch": 0.005989583333333334,
|
|
"step": 230
|
|
},
|
|
{
|
|
"loss": 0.08443466573953629,
|
|
"grad_norm": 6.942614555358887,
|
|
"learning_rate": 2.413793103448276e-07,
|
|
"num_tokens": 1527342.0,
|
|
"completions/mean_length": 136.5,
|
|
"completions/min_length": 76.0,
|
|
"completions/max_length": 289.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 136.5,
|
|
"completions/min_terminated_length": 76.0,
|
|
"completions/max_terminated_length": 289.0,
|
|
"tools/call_frequency": 2.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013153485022485256,
|
|
"sampling/sampling_logp_difference/max": 0.27301597595214844,
|
|
"sampling/importance_sampling_ratio/min": 0.5421993136405945,
|
|
"sampling/importance_sampling_ratio/mean": 0.9781385660171509,
|
|
"sampling/importance_sampling_ratio/max": 1.3869011402130127,
|
|
"entropy": 0.4315082561224699,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.417220417410135,
|
|
"epoch": 0.006015625,
|
|
"step": 231
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 2.3793103448275863e-07,
|
|
"num_tokens": 1533616.0,
|
|
"completions/mean_length": 98.25,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 192.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 98.25,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 192.0,
|
|
"tools/call_frequency": 1.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011975917033851147,
|
|
"sampling/sampling_logp_difference/max": 0.19208061695098877,
|
|
"sampling/importance_sampling_ratio/min": 0.6422286033630371,
|
|
"sampling/importance_sampling_ratio/mean": 1.0429977178573608,
|
|
"sampling/importance_sampling_ratio/max": 1.6442532539367676,
|
|
"entropy": 0.4107196293771267,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 3.9623564667999744,
|
|
"epoch": 0.0060416666666666665,
|
|
"step": 232
|
|
},
|
|
{
|
|
"loss": 0.1327264904975891,
|
|
"grad_norm": 6.5794806480407715,
|
|
"learning_rate": 2.3448275862068964e-07,
|
|
"num_tokens": 1540015.0,
|
|
"completions/mean_length": 113.625,
|
|
"completions/min_length": 70.0,
|
|
"completions/max_length": 225.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 113.625,
|
|
"completions/min_terminated_length": 70.0,
|
|
"completions/max_terminated_length": 225.0,
|
|
"tools/call_frequency": 2.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01154260616749525,
|
|
"sampling/sampling_logp_difference/max": 0.32723474502563477,
|
|
"sampling/importance_sampling_ratio/min": 0.6554647088050842,
|
|
"sampling/importance_sampling_ratio/mean": 0.9892325401306152,
|
|
"sampling/importance_sampling_ratio/max": 1.4028586149215698,
|
|
"entropy": 0.3924696184694767,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.227699548006058,
|
|
"epoch": 0.006067708333333333,
|
|
"step": 233
|
|
},
|
|
{
|
|
"loss": 0.402605265378952,
|
|
"grad_norm": 7.423785209655762,
|
|
"learning_rate": 2.3103448275862066e-07,
|
|
"num_tokens": 1546816.0,
|
|
"completions/mean_length": 164.5,
|
|
"completions/min_length": 72.0,
|
|
"completions/max_length": 365.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 164.5,
|
|
"completions/min_terminated_length": 72.0,
|
|
"completions/max_terminated_length": 365.0,
|
|
"tools/call_frequency": 3.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013277391903102398,
|
|
"sampling/sampling_logp_difference/max": 0.21643924713134766,
|
|
"sampling/importance_sampling_ratio/min": 0.5706875920295715,
|
|
"sampling/importance_sampling_ratio/mean": 0.7940878868103027,
|
|
"sampling/importance_sampling_ratio/max": 1.1356279850006104,
|
|
"entropy": 0.46284560672938824,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.881978258490562,
|
|
"epoch": 0.00609375,
|
|
"step": 234
|
|
},
|
|
{
|
|
"loss": 0.4352855384349823,
|
|
"grad_norm": 8.960577964782715,
|
|
"learning_rate": 2.2758620689655173e-07,
|
|
"num_tokens": 1553274.0,
|
|
"completions/mean_length": 121.875,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 250.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 121.875,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 250.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009843465872108936,
|
|
"sampling/sampling_logp_difference/max": 0.2133629322052002,
|
|
"sampling/importance_sampling_ratio/min": 0.5495107769966125,
|
|
"sampling/importance_sampling_ratio/mean": 0.9446932077407837,
|
|
"sampling/importance_sampling_ratio/max": 1.1463549137115479,
|
|
"entropy": 0.3563223108649254,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.381809528917074,
|
|
"epoch": 0.006119791666666667,
|
|
"step": 235
|
|
},
|
|
{
|
|
"loss": 0.2254079431295395,
|
|
"grad_norm": 7.389021396636963,
|
|
"learning_rate": 2.2413793103448274e-07,
|
|
"num_tokens": 1560059.0,
|
|
"completions/mean_length": 162.625,
|
|
"completions/min_length": 74.0,
|
|
"completions/max_length": 296.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 162.625,
|
|
"completions/min_terminated_length": 74.0,
|
|
"completions/max_terminated_length": 296.0,
|
|
"tools/call_frequency": 3.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012515394017100334,
|
|
"sampling/sampling_logp_difference/max": 0.27469396591186523,
|
|
"sampling/importance_sampling_ratio/min": 0.5793212056159973,
|
|
"sampling/importance_sampling_ratio/mean": 0.9545640349388123,
|
|
"sampling/importance_sampling_ratio/max": 1.430768609046936,
|
|
"entropy": 0.4306243769824505,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.27208286896348,
|
|
"epoch": 0.006145833333333333,
|
|
"step": 236
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 2.206896551724138e-07,
|
|
"num_tokens": 1566444.0,
|
|
"completions/mean_length": 112.5,
|
|
"completions/min_length": 74.0,
|
|
"completions/max_length": 220.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 112.5,
|
|
"completions/min_terminated_length": 74.0,
|
|
"completions/max_terminated_length": 220.0,
|
|
"tools/call_frequency": 1.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012234870344400406,
|
|
"sampling/sampling_logp_difference/max": 0.2455425262451172,
|
|
"sampling/importance_sampling_ratio/min": 0.4859005808830261,
|
|
"sampling/importance_sampling_ratio/mean": 0.9904327988624573,
|
|
"sampling/importance_sampling_ratio/max": 1.4598642587661743,
|
|
"entropy": 0.41240089014172554,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.247735887765884,
|
|
"epoch": 0.006171875,
|
|
"step": 237
|
|
},
|
|
{
|
|
"loss": 0.14990873634815216,
|
|
"grad_norm": 5.708603858947754,
|
|
"learning_rate": 2.172413793103448e-07,
|
|
"num_tokens": 1573107.0,
|
|
"completions/mean_length": 146.75,
|
|
"completions/min_length": 66.0,
|
|
"completions/max_length": 372.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 146.75,
|
|
"completions/min_terminated_length": 66.0,
|
|
"completions/max_terminated_length": 372.0,
|
|
"tools/call_frequency": 2.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010239748284220695,
|
|
"sampling/sampling_logp_difference/max": 0.22030401229858398,
|
|
"sampling/importance_sampling_ratio/min": 0.4491298496723175,
|
|
"sampling/importance_sampling_ratio/mean": 0.9548370242118835,
|
|
"sampling/importance_sampling_ratio/max": 1.6403262615203857,
|
|
"entropy": 0.38685277476906776,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.7222266383469105,
|
|
"epoch": 0.006197916666666667,
|
|
"step": 238
|
|
},
|
|
{
|
|
"loss": 0.30410444736480713,
|
|
"grad_norm": 6.919494152069092,
|
|
"learning_rate": 2.1379310344827587e-07,
|
|
"num_tokens": 1579653.0,
|
|
"completions/mean_length": 132.875,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 312.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 132.875,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 312.0,
|
|
"tools/call_frequency": 2.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012275275774300098,
|
|
"sampling/sampling_logp_difference/max": 0.4161001443862915,
|
|
"sampling/importance_sampling_ratio/min": 0.5186476707458496,
|
|
"sampling/importance_sampling_ratio/mean": 0.7974859476089478,
|
|
"sampling/importance_sampling_ratio/max": 1.1094839572906494,
|
|
"entropy": 0.3361106123775244,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.908729072660208,
|
|
"epoch": 0.006223958333333333,
|
|
"step": 239
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 2.103448275862069e-07,
|
|
"num_tokens": 1585795.0,
|
|
"completions/mean_length": 82.25,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 107.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 82.25,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 107.0,
|
|
"tools/call_frequency": 1.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01233686413615942,
|
|
"sampling/sampling_logp_difference/max": 0.4248065948486328,
|
|
"sampling/importance_sampling_ratio/min": 0.5713846683502197,
|
|
"sampling/importance_sampling_ratio/mean": 1.1775957345962524,
|
|
"sampling/importance_sampling_ratio/max": 2.224435567855835,
|
|
"entropy": 0.342247923836112,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 3.64138338342309,
|
|
"epoch": 0.00625,
|
|
"step": 240
|
|
},
|
|
{
|
|
"loss": 0.2744162380695343,
|
|
"grad_norm": 9.401144981384277,
|
|
"learning_rate": 2.0689655172413793e-07,
|
|
"num_tokens": 1592447.0,
|
|
"completions/mean_length": 146.0,
|
|
"completions/min_length": 74.0,
|
|
"completions/max_length": 257.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 146.0,
|
|
"completions/min_terminated_length": 74.0,
|
|
"completions/max_terminated_length": 257.0,
|
|
"tools/call_frequency": 2.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01303884293884039,
|
|
"sampling/sampling_logp_difference/max": 0.38067054748535156,
|
|
"sampling/importance_sampling_ratio/min": 0.5110273361206055,
|
|
"sampling/importance_sampling_ratio/mean": 0.8686518669128418,
|
|
"sampling/importance_sampling_ratio/max": 1.1720399856567383,
|
|
"entropy": 0.421370230615139,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.388774648308754,
|
|
"epoch": 0.006276041666666667,
|
|
"step": 241
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 2.0344827586206895e-07,
|
|
"num_tokens": 1598788.0,
|
|
"completions/mean_length": 106.25,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 184.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 106.25,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 184.0,
|
|
"tools/call_frequency": 1.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012026702985167503,
|
|
"sampling/sampling_logp_difference/max": 0.25853919982910156,
|
|
"sampling/importance_sampling_ratio/min": 0.77313631772995,
|
|
"sampling/importance_sampling_ratio/mean": 1.1583786010742188,
|
|
"sampling/importance_sampling_ratio/max": 1.631077766418457,
|
|
"entropy": 0.34156747721135616,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 3.996856901794672,
|
|
"epoch": 0.006302083333333333,
|
|
"step": 242
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 2e-07,
|
|
"num_tokens": 1605088.0,
|
|
"completions/mean_length": 101.75,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 143.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 101.75,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 143.0,
|
|
"tools/call_frequency": 1.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01177971251308918,
|
|
"sampling/sampling_logp_difference/max": 0.3938133716583252,
|
|
"sampling/importance_sampling_ratio/min": 0.5634831786155701,
|
|
"sampling/importance_sampling_ratio/mean": 0.9299900531768799,
|
|
"sampling/importance_sampling_ratio/max": 1.3045389652252197,
|
|
"entropy": 0.3557300139218569,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 3.792428206652403,
|
|
"epoch": 0.006328125,
|
|
"step": 243
|
|
},
|
|
{
|
|
"loss": 0.8968291282653809,
|
|
"grad_norm": 20.50238800048828,
|
|
"learning_rate": 1.9655172413793103e-07,
|
|
"num_tokens": 1611475.0,
|
|
"completions/mean_length": 112.5,
|
|
"completions/min_length": 77.0,
|
|
"completions/max_length": 261.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 112.5,
|
|
"completions/min_terminated_length": 77.0,
|
|
"completions/max_terminated_length": 261.0,
|
|
"tools/call_frequency": 1.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012752820737659931,
|
|
"sampling/sampling_logp_difference/max": 0.3744630813598633,
|
|
"sampling/importance_sampling_ratio/min": 0.5593265295028687,
|
|
"sampling/importance_sampling_ratio/mean": 1.1518104076385498,
|
|
"sampling/importance_sampling_ratio/max": 1.924498438835144,
|
|
"entropy": 0.3892900198698044,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.258405860513449,
|
|
"epoch": 0.006354166666666667,
|
|
"step": 244
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 1.9310344827586205e-07,
|
|
"num_tokens": 1617932.0,
|
|
"completions/mean_length": 121.75,
|
|
"completions/min_length": 70.0,
|
|
"completions/max_length": 301.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 121.75,
|
|
"completions/min_terminated_length": 70.0,
|
|
"completions/max_terminated_length": 301.0,
|
|
"tools/call_frequency": 2.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013255810365080833,
|
|
"sampling/sampling_logp_difference/max": 0.3091144561767578,
|
|
"sampling/importance_sampling_ratio/min": 0.2775188088417053,
|
|
"sampling/importance_sampling_ratio/mean": 0.8584268093109131,
|
|
"sampling/importance_sampling_ratio/max": 1.1039010286331177,
|
|
"entropy": 0.3750423062592745,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.395967200398445,
|
|
"epoch": 0.006380208333333333,
|
|
"step": 245
|
|
},
|
|
{
|
|
"loss": 0.1423274278640747,
|
|
"grad_norm": 4.962782382965088,
|
|
"learning_rate": 1.896551724137931e-07,
|
|
"num_tokens": 1624784.0,
|
|
"completions/mean_length": 169.625,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 252.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 169.625,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 252.0,
|
|
"tools/call_frequency": 3.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013426621444523335,
|
|
"sampling/sampling_logp_difference/max": 0.2526674270629883,
|
|
"sampling/importance_sampling_ratio/min": 0.36478468775749207,
|
|
"sampling/importance_sampling_ratio/mean": 0.8246872425079346,
|
|
"sampling/importance_sampling_ratio/max": 1.2307977676391602,
|
|
"entropy": 0.4405743684619665,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.843937441706657,
|
|
"epoch": 0.00640625,
|
|
"step": 246
|
|
},
|
|
{
|
|
"loss": 0.2473740428686142,
|
|
"grad_norm": 7.346534729003906,
|
|
"learning_rate": 1.8620689655172414e-07,
|
|
"num_tokens": 1631330.0,
|
|
"completions/mean_length": 133.125,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 291.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 133.125,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 291.0,
|
|
"tools/call_frequency": 2.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011962310411036015,
|
|
"sampling/sampling_logp_difference/max": 0.30948901176452637,
|
|
"sampling/importance_sampling_ratio/min": 0.51829594373703,
|
|
"sampling/importance_sampling_ratio/mean": 0.9812578558921814,
|
|
"sampling/importance_sampling_ratio/max": 1.4125739336013794,
|
|
"entropy": 0.3682870827615261,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.540961917489767,
|
|
"epoch": 0.006432291666666667,
|
|
"step": 247
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 1.8275862068965518e-07,
|
|
"num_tokens": 1637739.0,
|
|
"completions/mean_length": 115.125,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 261.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 115.125,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 261.0,
|
|
"tools/call_frequency": 2.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011308192275464535,
|
|
"sampling/sampling_logp_difference/max": 0.2711300849914551,
|
|
"sampling/importance_sampling_ratio/min": 0.8209143280982971,
|
|
"sampling/importance_sampling_ratio/mean": 1.1564793586730957,
|
|
"sampling/importance_sampling_ratio/max": 1.8234361410140991,
|
|
"entropy": 0.3624811824411154,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.31484991312027,
|
|
"epoch": 0.006458333333333333,
|
|
"step": 248
|
|
},
|
|
{
|
|
"loss": 0.07034649699926376,
|
|
"grad_norm": 5.420164108276367,
|
|
"learning_rate": 1.793103448275862e-07,
|
|
"num_tokens": 1644229.0,
|
|
"completions/mean_length": 125.5,
|
|
"completions/min_length": 72.0,
|
|
"completions/max_length": 270.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 125.5,
|
|
"completions/min_terminated_length": 72.0,
|
|
"completions/max_terminated_length": 270.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012347054667770863,
|
|
"sampling/sampling_logp_difference/max": 0.3436160087585449,
|
|
"sampling/importance_sampling_ratio/min": 0.44767650961875916,
|
|
"sampling/importance_sampling_ratio/mean": 0.8431032299995422,
|
|
"sampling/importance_sampling_ratio/max": 1.4753562211990356,
|
|
"entropy": 0.38236445374786854,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.447813358157873,
|
|
"epoch": 0.006484375,
|
|
"step": 249
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 1.758620689655172e-07,
|
|
"num_tokens": 1650582.0,
|
|
"completions/mean_length": 107.75,
|
|
"completions/min_length": 68.0,
|
|
"completions/max_length": 239.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 107.75,
|
|
"completions/min_terminated_length": 68.0,
|
|
"completions/max_terminated_length": 239.0,
|
|
"tools/call_frequency": 1.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011250519193708897,
|
|
"sampling/sampling_logp_difference/max": 0.20965266227722168,
|
|
"sampling/importance_sampling_ratio/min": 0.5831136107444763,
|
|
"sampling/importance_sampling_ratio/mean": 0.9154021739959717,
|
|
"sampling/importance_sampling_ratio/max": 1.5456960201263428,
|
|
"entropy": 0.3843225818127394,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.235317442566156,
|
|
"epoch": 0.006510416666666667,
|
|
"step": 250
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 1.7241379310344828e-07,
|
|
"num_tokens": 1656707.0,
|
|
"completions/mean_length": 79.875,
|
|
"completions/min_length": 74.0,
|
|
"completions/max_length": 90.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 79.875,
|
|
"completions/min_terminated_length": 74.0,
|
|
"completions/max_terminated_length": 90.0,
|
|
"tools/call_frequency": 1.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01105342898517847,
|
|
"sampling/sampling_logp_difference/max": 0.36299288272857666,
|
|
"sampling/importance_sampling_ratio/min": 0.45478442311286926,
|
|
"sampling/importance_sampling_ratio/mean": 0.8846508264541626,
|
|
"sampling/importance_sampling_ratio/max": 1.4821677207946777,
|
|
"entropy": 0.33434370532631874,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 3.5552473478019238,
|
|
"epoch": 0.006536458333333333,
|
|
"step": 251
|
|
},
|
|
{
|
|
"loss": 0.7705017328262329,
|
|
"grad_norm": 11.779228210449219,
|
|
"learning_rate": 1.689655172413793e-07,
|
|
"num_tokens": 1663112.0,
|
|
"completions/mean_length": 115.0,
|
|
"completions/min_length": 70.0,
|
|
"completions/max_length": 234.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 115.0,
|
|
"completions/min_terminated_length": 70.0,
|
|
"completions/max_terminated_length": 234.0,
|
|
"tools/call_frequency": 2.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010739600285887718,
|
|
"sampling/sampling_logp_difference/max": 0.2691793441772461,
|
|
"sampling/importance_sampling_ratio/min": 0.6300632953643799,
|
|
"sampling/importance_sampling_ratio/mean": 0.9815887212753296,
|
|
"sampling/importance_sampling_ratio/max": 1.6451809406280518,
|
|
"entropy": 0.33214167691767216,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.225358031690121,
|
|
"epoch": 0.0065625,
|
|
"step": 252
|
|
},
|
|
{
|
|
"loss": 0.3063722550868988,
|
|
"grad_norm": 9.069360733032227,
|
|
"learning_rate": 1.6551724137931034e-07,
|
|
"num_tokens": 1669629.0,
|
|
"completions/mean_length": 128.625,
|
|
"completions/min_length": 66.0,
|
|
"completions/max_length": 267.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 128.625,
|
|
"completions/min_terminated_length": 66.0,
|
|
"completions/max_terminated_length": 267.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011863093823194504,
|
|
"sampling/sampling_logp_difference/max": 0.218658447265625,
|
|
"sampling/importance_sampling_ratio/min": 0.4986332952976227,
|
|
"sampling/importance_sampling_ratio/mean": 0.837560772895813,
|
|
"sampling/importance_sampling_ratio/max": 1.3050978183746338,
|
|
"entropy": 0.41538802348077297,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.744722697883844,
|
|
"epoch": 0.006588541666666667,
|
|
"step": 253
|
|
},
|
|
{
|
|
"loss": 0.6463911533355713,
|
|
"grad_norm": 11.25007152557373,
|
|
"learning_rate": 1.6206896551724136e-07,
|
|
"num_tokens": 1676247.0,
|
|
"completions/mean_length": 141.75,
|
|
"completions/min_length": 76.0,
|
|
"completions/max_length": 269.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 141.75,
|
|
"completions/min_terminated_length": 76.0,
|
|
"completions/max_terminated_length": 269.0,
|
|
"tools/call_frequency": 2.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01386319287121296,
|
|
"sampling/sampling_logp_difference/max": 0.49417829513549805,
|
|
"sampling/importance_sampling_ratio/min": 0.929777979850769,
|
|
"sampling/importance_sampling_ratio/mean": 1.1681396961212158,
|
|
"sampling/importance_sampling_ratio/max": 1.6235978603363037,
|
|
"entropy": 0.4391930364072323,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.795429974794388,
|
|
"epoch": 0.006614583333333333,
|
|
"step": 254
|
|
},
|
|
{
|
|
"loss": -0.25452253222465515,
|
|
"grad_norm": 2.4696967601776123,
|
|
"learning_rate": 1.5862068965517243e-07,
|
|
"num_tokens": 1682814.0,
|
|
"completions/mean_length": 136.0,
|
|
"completions/min_length": 75.0,
|
|
"completions/max_length": 289.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 136.0,
|
|
"completions/min_terminated_length": 75.0,
|
|
"completions/max_terminated_length": 289.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012699998915195465,
|
|
"sampling/sampling_logp_difference/max": 0.3478074073791504,
|
|
"sampling/importance_sampling_ratio/min": 0.0,
|
|
"sampling/importance_sampling_ratio/mean": 0.8453823328018188,
|
|
"sampling/importance_sampling_ratio/max": 1.3936424255371094,
|
|
"entropy": 0.401802821084857,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.087458718568087,
|
|
"epoch": 0.006640625,
|
|
"step": 255
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 1.5517241379310344e-07,
|
|
"num_tokens": 1689417.0,
|
|
"completions/mean_length": 139.0,
|
|
"completions/min_length": 73.0,
|
|
"completions/max_length": 229.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 139.0,
|
|
"completions/min_terminated_length": 73.0,
|
|
"completions/max_terminated_length": 229.0,
|
|
"tools/call_frequency": 2.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01362011581659317,
|
|
"sampling/sampling_logp_difference/max": 0.2250657081604004,
|
|
"sampling/importance_sampling_ratio/min": 0.37478578090667725,
|
|
"sampling/importance_sampling_ratio/mean": 0.8172546625137329,
|
|
"sampling/importance_sampling_ratio/max": 1.4671869277954102,
|
|
"entropy": 0.4447487201541662,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.783331546932459,
|
|
"epoch": 0.006666666666666667,
|
|
"step": 256
|
|
},
|
|
{
|
|
"loss": 0.042479008436203,
|
|
"grad_norm": 6.792513370513916,
|
|
"learning_rate": 1.5172413793103449e-07,
|
|
"num_tokens": 1696005.0,
|
|
"completions/mean_length": 137.875,
|
|
"completions/min_length": 77.0,
|
|
"completions/max_length": 282.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 137.875,
|
|
"completions/min_terminated_length": 77.0,
|
|
"completions/max_terminated_length": 282.0,
|
|
"tools/call_frequency": 2.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01219947449862957,
|
|
"sampling/sampling_logp_difference/max": 0.3132779598236084,
|
|
"sampling/importance_sampling_ratio/min": 0.5582106709480286,
|
|
"sampling/importance_sampling_ratio/mean": 1.054414987564087,
|
|
"sampling/importance_sampling_ratio/max": 1.6568481922149658,
|
|
"entropy": 0.40117553621530533,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.732860706746578,
|
|
"epoch": 0.0066927083333333335,
|
|
"step": 257
|
|
},
|
|
{
|
|
"loss": -0.028782352805137634,
|
|
"grad_norm": 6.8916850090026855,
|
|
"learning_rate": 1.482758620689655e-07,
|
|
"num_tokens": 1702736.0,
|
|
"completions/mean_length": 155.375,
|
|
"completions/min_length": 37.0,
|
|
"completions/max_length": 297.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 155.375,
|
|
"completions/min_terminated_length": 37.0,
|
|
"completions/max_terminated_length": 297.0,
|
|
"tools/call_frequency": 3.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.036250002682209015,
|
|
"rewards/reward_func/std": 0.019955307245254517,
|
|
"reward": 0.036250002682209015,
|
|
"reward_std": 0.019955307245254517,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01261419802904129,
|
|
"sampling/sampling_logp_difference/max": 0.23758888244628906,
|
|
"sampling/importance_sampling_ratio/min": 0.8021863102912903,
|
|
"sampling/importance_sampling_ratio/mean": 1.0601112842559814,
|
|
"sampling/importance_sampling_ratio/max": 1.5224790573120117,
|
|
"entropy": 0.4475422278046608,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.898925796151161,
|
|
"epoch": 0.00671875,
|
|
"step": 258
|
|
},
|
|
{
|
|
"loss": 0.4860846996307373,
|
|
"grad_norm": 8.632187843322754,
|
|
"learning_rate": 1.4482758620689654e-07,
|
|
"num_tokens": 1709413.0,
|
|
"completions/mean_length": 149.0,
|
|
"completions/min_length": 78.0,
|
|
"completions/max_length": 229.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 149.0,
|
|
"completions/min_terminated_length": 78.0,
|
|
"completions/max_terminated_length": 229.0,
|
|
"tools/call_frequency": 3.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01191042736172676,
|
|
"sampling/sampling_logp_difference/max": 0.31433749198913574,
|
|
"sampling/importance_sampling_ratio/min": 0.7918771505355835,
|
|
"sampling/importance_sampling_ratio/mean": 1.0567115545272827,
|
|
"sampling/importance_sampling_ratio/max": 1.550087571144104,
|
|
"entropy": 0.4268493577837944,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.776560887694359,
|
|
"epoch": 0.006744791666666666,
|
|
"step": 259
|
|
},
|
|
{
|
|
"loss": 0.7819214463233948,
|
|
"grad_norm": 14.320728302001953,
|
|
"learning_rate": 1.413793103448276e-07,
|
|
"num_tokens": 1716061.0,
|
|
"completions/mean_length": 145.625,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 269.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 145.625,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 269.0,
|
|
"tools/call_frequency": 2.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013627855107188225,
|
|
"sampling/sampling_logp_difference/max": 0.2401266098022461,
|
|
"sampling/importance_sampling_ratio/min": 0.7329464554786682,
|
|
"sampling/importance_sampling_ratio/mean": 1.0565303564071655,
|
|
"sampling/importance_sampling_ratio/max": 1.8856542110443115,
|
|
"entropy": 0.45499586686491966,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.572375640273094,
|
|
"epoch": 0.0067708333333333336,
|
|
"step": 260
|
|
},
|
|
{
|
|
"loss": 0.07219955325126648,
|
|
"grad_norm": 4.486326217651367,
|
|
"learning_rate": 1.379310344827586e-07,
|
|
"num_tokens": 1722617.0,
|
|
"completions/mean_length": 132.75,
|
|
"completions/min_length": 70.0,
|
|
"completions/max_length": 231.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 132.75,
|
|
"completions/min_terminated_length": 70.0,
|
|
"completions/max_terminated_length": 231.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013247912749648094,
|
|
"sampling/sampling_logp_difference/max": 0.41723620891571045,
|
|
"sampling/importance_sampling_ratio/min": 0.31496456265449524,
|
|
"sampling/importance_sampling_ratio/mean": 0.6999540328979492,
|
|
"sampling/importance_sampling_ratio/max": 0.993986964225769,
|
|
"entropy": 0.48321819491684437,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.35433280095458,
|
|
"epoch": 0.006796875,
|
|
"step": 261
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 1.3448275862068965e-07,
|
|
"num_tokens": 1729090.0,
|
|
"completions/mean_length": 123.75,
|
|
"completions/min_length": 75.0,
|
|
"completions/max_length": 251.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 123.75,
|
|
"completions/min_terminated_length": 75.0,
|
|
"completions/max_terminated_length": 251.0,
|
|
"tools/call_frequency": 2.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010842503048479557,
|
|
"sampling/sampling_logp_difference/max": 0.2613506317138672,
|
|
"sampling/importance_sampling_ratio/min": 0.7672865986824036,
|
|
"sampling/importance_sampling_ratio/mean": 1.244701862335205,
|
|
"sampling/importance_sampling_ratio/max": 2.468782901763916,
|
|
"entropy": 0.3914359211921692,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.254163131117821,
|
|
"epoch": 0.006822916666666666,
|
|
"step": 262
|
|
},
|
|
{
|
|
"loss": 0.15148787200450897,
|
|
"grad_norm": 6.149950981140137,
|
|
"learning_rate": 1.310344827586207e-07,
|
|
"num_tokens": 1735777.0,
|
|
"completions/mean_length": 150.25,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 288.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 150.25,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 288.0,
|
|
"tools/call_frequency": 3.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011738087050616741,
|
|
"sampling/sampling_logp_difference/max": 0.30169081687927246,
|
|
"sampling/importance_sampling_ratio/min": 0.5324463844299316,
|
|
"sampling/importance_sampling_ratio/mean": 0.781113862991333,
|
|
"sampling/importance_sampling_ratio/max": 1.0696625709533691,
|
|
"entropy": 0.38973900489509106,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.607690282166004,
|
|
"epoch": 0.006848958333333334,
|
|
"step": 263
|
|
},
|
|
{
|
|
"loss": 0.37017062306404114,
|
|
"grad_norm": 11.221770286560059,
|
|
"learning_rate": 1.2758620689655173e-07,
|
|
"num_tokens": 1742281.0,
|
|
"completions/mean_length": 127.625,
|
|
"completions/min_length": 79.0,
|
|
"completions/max_length": 287.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 127.625,
|
|
"completions/min_terminated_length": 79.0,
|
|
"completions/max_terminated_length": 287.0,
|
|
"tools/call_frequency": 2.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013899856247007847,
|
|
"sampling/sampling_logp_difference/max": 0.24550151824951172,
|
|
"sampling/importance_sampling_ratio/min": 0.5695619583129883,
|
|
"sampling/importance_sampling_ratio/mean": 0.8453925848007202,
|
|
"sampling/importance_sampling_ratio/max": 1.2200438976287842,
|
|
"entropy": 0.47930552065372467,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.319764152169228,
|
|
"epoch": 0.006875,
|
|
"step": 264
|
|
},
|
|
{
|
|
"loss": 0.08389385044574738,
|
|
"grad_norm": 8.317436218261719,
|
|
"learning_rate": 1.2413793103448275e-07,
|
|
"num_tokens": 1748960.0,
|
|
"completions/mean_length": 149.375,
|
|
"completions/min_length": 72.0,
|
|
"completions/max_length": 260.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 149.375,
|
|
"completions/min_terminated_length": 72.0,
|
|
"completions/max_terminated_length": 260.0,
|
|
"tools/call_frequency": 3.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010441875085234642,
|
|
"sampling/sampling_logp_difference/max": 0.2313232421875,
|
|
"sampling/importance_sampling_ratio/min": 0.8075160384178162,
|
|
"sampling/importance_sampling_ratio/mean": 1.1571221351623535,
|
|
"sampling/importance_sampling_ratio/max": 1.985337495803833,
|
|
"entropy": 0.42238908633589745,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.607502739876509,
|
|
"epoch": 0.0069010416666666664,
|
|
"step": 265
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 1.206896551724138e-07,
|
|
"num_tokens": 1755561.0,
|
|
"completions/mean_length": 138.875,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 322.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 138.875,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 322.0,
|
|
"tools/call_frequency": 2.25,
|
|
"tools/failure_frequency": 0.2777777910232544,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011237440630793571,
|
|
"sampling/sampling_logp_difference/max": 0.24850058555603027,
|
|
"sampling/importance_sampling_ratio/min": 0.8335959911346436,
|
|
"sampling/importance_sampling_ratio/mean": 1.073771357536316,
|
|
"sampling/importance_sampling_ratio/max": 1.2142795324325562,
|
|
"entropy": 0.35598164796829224,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.57135247439146,
|
|
"epoch": 0.006927083333333334,
|
|
"step": 266
|
|
},
|
|
{
|
|
"loss": 0.9753967523574829,
|
|
"grad_norm": 18.79526138305664,
|
|
"learning_rate": 1.1724137931034482e-07,
|
|
"num_tokens": 1761972.0,
|
|
"completions/mean_length": 115.75,
|
|
"completions/min_length": 70.0,
|
|
"completions/max_length": 274.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 115.75,
|
|
"completions/min_terminated_length": 70.0,
|
|
"completions/max_terminated_length": 274.0,
|
|
"tools/call_frequency": 2.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011597433127462864,
|
|
"sampling/sampling_logp_difference/max": 0.26330816745758057,
|
|
"sampling/importance_sampling_ratio/min": 0.6595337390899658,
|
|
"sampling/importance_sampling_ratio/mean": 1.1310017108917236,
|
|
"sampling/importance_sampling_ratio/max": 2.041294813156128,
|
|
"entropy": 0.37283606082201004,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.628953363746405,
|
|
"epoch": 0.006953125,
|
|
"step": 267
|
|
},
|
|
{
|
|
"loss": 0.1407385766506195,
|
|
"grad_norm": 6.709783554077148,
|
|
"learning_rate": 1.1379310344827586e-07,
|
|
"num_tokens": 1768688.0,
|
|
"completions/mean_length": 153.125,
|
|
"completions/min_length": 76.0,
|
|
"completions/max_length": 269.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 153.125,
|
|
"completions/min_terminated_length": 76.0,
|
|
"completions/max_terminated_length": 269.0,
|
|
"tools/call_frequency": 3.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011658101342618465,
|
|
"sampling/sampling_logp_difference/max": 0.20760440826416016,
|
|
"sampling/importance_sampling_ratio/min": 0.29518187046051025,
|
|
"sampling/importance_sampling_ratio/mean": 0.8446435332298279,
|
|
"sampling/importance_sampling_ratio/max": 1.132695198059082,
|
|
"entropy": 0.381710696965456,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.56982546672225,
|
|
"epoch": 0.0069791666666666665,
|
|
"step": 268
|
|
},
|
|
{
|
|
"loss": 0.2527141571044922,
|
|
"grad_norm": 10.2232084274292,
|
|
"learning_rate": 1.103448275862069e-07,
|
|
"num_tokens": 1775345.0,
|
|
"completions/mean_length": 145.625,
|
|
"completions/min_length": 76.0,
|
|
"completions/max_length": 265.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 145.625,
|
|
"completions/min_terminated_length": 76.0,
|
|
"completions/max_terminated_length": 265.0,
|
|
"tools/call_frequency": 2.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013182499445974827,
|
|
"sampling/sampling_logp_difference/max": 0.253065288066864,
|
|
"sampling/importance_sampling_ratio/min": 0.4400932788848877,
|
|
"sampling/importance_sampling_ratio/mean": 1.2850861549377441,
|
|
"sampling/importance_sampling_ratio/max": 1.828995943069458,
|
|
"entropy": 0.4312727153301239,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.711833827197552,
|
|
"epoch": 0.007005208333333333,
|
|
"step": 269
|
|
},
|
|
{
|
|
"loss": 0.3850674331188202,
|
|
"grad_norm": 11.476179122924805,
|
|
"learning_rate": 1.0689655172413794e-07,
|
|
"num_tokens": 1781847.0,
|
|
"completions/mean_length": 126.75,
|
|
"completions/min_length": 76.0,
|
|
"completions/max_length": 243.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 126.75,
|
|
"completions/min_terminated_length": 76.0,
|
|
"completions/max_terminated_length": 243.0,
|
|
"tools/call_frequency": 2.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013755693100392818,
|
|
"sampling/sampling_logp_difference/max": 0.287384033203125,
|
|
"sampling/importance_sampling_ratio/min": 0.7775720357894897,
|
|
"sampling/importance_sampling_ratio/mean": 1.0901168584823608,
|
|
"sampling/importance_sampling_ratio/max": 1.621045708656311,
|
|
"entropy": 0.4050389751791954,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.5725556537508965,
|
|
"epoch": 0.00703125,
|
|
"step": 270
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 1.0344827586206897e-07,
|
|
"num_tokens": 1788137.0,
|
|
"completions/mean_length": 100.25,
|
|
"completions/min_length": 76.0,
|
|
"completions/max_length": 128.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 100.25,
|
|
"completions/min_terminated_length": 76.0,
|
|
"completions/max_terminated_length": 128.0,
|
|
"tools/call_frequency": 1.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011761503294110298,
|
|
"sampling/sampling_logp_difference/max": 0.24228429794311523,
|
|
"sampling/importance_sampling_ratio/min": 0.4475219249725342,
|
|
"sampling/importance_sampling_ratio/mean": 0.9587810039520264,
|
|
"sampling/importance_sampling_ratio/max": 1.3084263801574707,
|
|
"entropy": 0.36945314705371857,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.326859299093485,
|
|
"epoch": 0.007057291666666667,
|
|
"step": 271
|
|
},
|
|
{
|
|
"loss": 0.13966688513755798,
|
|
"grad_norm": 7.985146999359131,
|
|
"learning_rate": 1e-07,
|
|
"num_tokens": 1794842.0,
|
|
"completions/mean_length": 152.0,
|
|
"completions/min_length": 69.0,
|
|
"completions/max_length": 257.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 152.0,
|
|
"completions/min_terminated_length": 69.0,
|
|
"completions/max_terminated_length": 257.0,
|
|
"tools/call_frequency": 3.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012257814407348633,
|
|
"sampling/sampling_logp_difference/max": 0.23528480529785156,
|
|
"sampling/importance_sampling_ratio/min": 0.5759143233299255,
|
|
"sampling/importance_sampling_ratio/mean": 0.8540890216827393,
|
|
"sampling/importance_sampling_ratio/max": 1.3689486980438232,
|
|
"entropy": 0.4255378097295761,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.523588839918375,
|
|
"epoch": 0.007083333333333333,
|
|
"step": 272
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 9.655172413793103e-08,
|
|
"num_tokens": 1801073.0,
|
|
"completions/mean_length": 93.125,
|
|
"completions/min_length": 74.0,
|
|
"completions/max_length": 183.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 93.125,
|
|
"completions/min_terminated_length": 74.0,
|
|
"completions/max_terminated_length": 183.0,
|
|
"tools/call_frequency": 1.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009758113883435726,
|
|
"sampling/sampling_logp_difference/max": 0.20165228843688965,
|
|
"sampling/importance_sampling_ratio/min": 0.711251974105835,
|
|
"sampling/importance_sampling_ratio/mean": 0.9871619939804077,
|
|
"sampling/importance_sampling_ratio/max": 1.5335099697113037,
|
|
"entropy": 0.36211518943309784,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 3.8618279322981834,
|
|
"epoch": 0.007109375,
|
|
"step": 273
|
|
},
|
|
{
|
|
"loss": 0.7438125014305115,
|
|
"grad_norm": 20.87550163269043,
|
|
"learning_rate": 9.310344827586207e-08,
|
|
"num_tokens": 1807528.0,
|
|
"completions/mean_length": 121.25,
|
|
"completions/min_length": 78.0,
|
|
"completions/max_length": 227.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 121.25,
|
|
"completions/min_terminated_length": 78.0,
|
|
"completions/max_terminated_length": 227.0,
|
|
"tools/call_frequency": 2.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011054747737944126,
|
|
"sampling/sampling_logp_difference/max": 0.306357741355896,
|
|
"sampling/importance_sampling_ratio/min": 0.584359347820282,
|
|
"sampling/importance_sampling_ratio/mean": 1.1412510871887207,
|
|
"sampling/importance_sampling_ratio/max": 1.7848306894302368,
|
|
"entropy": 0.3993511199951172,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.4329588785767555,
|
|
"epoch": 0.007135416666666667,
|
|
"step": 274
|
|
},
|
|
{
|
|
"loss": 0.16193309426307678,
|
|
"grad_norm": 4.9770073890686035,
|
|
"learning_rate": 8.96551724137931e-08,
|
|
"num_tokens": 1814468.0,
|
|
"completions/mean_length": 180.125,
|
|
"completions/min_length": 73.0,
|
|
"completions/max_length": 385.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 180.125,
|
|
"completions/min_terminated_length": 73.0,
|
|
"completions/max_terminated_length": 385.0,
|
|
"tools/call_frequency": 3.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01576872169971466,
|
|
"sampling/sampling_logp_difference/max": 0.3658018112182617,
|
|
"sampling/importance_sampling_ratio/min": 0.4295932948589325,
|
|
"sampling/importance_sampling_ratio/mean": 0.8592667579650879,
|
|
"sampling/importance_sampling_ratio/max": 1.5670956373214722,
|
|
"entropy": 0.47048109397292137,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.859539113938808,
|
|
"epoch": 0.007161458333333333,
|
|
"step": 275
|
|
},
|
|
{
|
|
"loss": 0.40237608551979065,
|
|
"grad_norm": 6.163737773895264,
|
|
"learning_rate": 8.620689655172414e-08,
|
|
"num_tokens": 1821714.0,
|
|
"completions/mean_length": 219.125,
|
|
"completions/min_length": 85.0,
|
|
"completions/max_length": 685.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 219.125,
|
|
"completions/min_terminated_length": 85.0,
|
|
"completions/max_terminated_length": 685.0,
|
|
"tools/call_frequency": 4.125,
|
|
"tools/failure_frequency": 0.3333333432674408,
|
|
"rewards/reward_func/mean": 0.03999999910593033,
|
|
"rewards/reward_func/std": 0.01927248388528824,
|
|
"reward": 0.03999999910593033,
|
|
"reward_std": 0.01927248202264309,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.014155134558677673,
|
|
"sampling/sampling_logp_difference/max": 0.2597932815551758,
|
|
"sampling/importance_sampling_ratio/min": 0.4432338774204254,
|
|
"sampling/importance_sampling_ratio/mean": 0.8505239486694336,
|
|
"sampling/importance_sampling_ratio/max": 1.874996542930603,
|
|
"entropy": 0.4612193629145622,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 6.906406059861183,
|
|
"epoch": 0.0071875,
|
|
"step": 276
|
|
},
|
|
{
|
|
"loss": 0.44495847821235657,
|
|
"grad_norm": 11.078022003173828,
|
|
"learning_rate": 8.275862068965517e-08,
|
|
"num_tokens": 1828072.0,
|
|
"completions/mean_length": 109.125,
|
|
"completions/min_length": 72.0,
|
|
"completions/max_length": 257.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 109.125,
|
|
"completions/min_terminated_length": 72.0,
|
|
"completions/max_terminated_length": 257.0,
|
|
"tools/call_frequency": 1.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01147474069148302,
|
|
"sampling/sampling_logp_difference/max": 0.31108736991882324,
|
|
"sampling/importance_sampling_ratio/min": 0.571040153503418,
|
|
"sampling/importance_sampling_ratio/mean": 0.8329801559448242,
|
|
"sampling/importance_sampling_ratio/max": 1.3575739860534668,
|
|
"entropy": 0.3342920280992985,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.449655279517174,
|
|
"epoch": 0.007213541666666667,
|
|
"step": 277
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 7.931034482758621e-08,
|
|
"num_tokens": 1834352.0,
|
|
"completions/mean_length": 98.375,
|
|
"completions/min_length": 65.0,
|
|
"completions/max_length": 205.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 98.375,
|
|
"completions/min_terminated_length": 65.0,
|
|
"completions/max_terminated_length": 205.0,
|
|
"tools/call_frequency": 1.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011004039086401463,
|
|
"sampling/sampling_logp_difference/max": 0.2481316328048706,
|
|
"sampling/importance_sampling_ratio/min": 0.6326379776000977,
|
|
"sampling/importance_sampling_ratio/mean": 0.9662011861801147,
|
|
"sampling/importance_sampling_ratio/max": 1.8022511005401611,
|
|
"entropy": 0.32181683368980885,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.241747297346592,
|
|
"epoch": 0.007239583333333333,
|
|
"step": 278
|
|
},
|
|
{
|
|
"loss": 0.44562286138534546,
|
|
"grad_norm": 8.47037410736084,
|
|
"learning_rate": 7.586206896551724e-08,
|
|
"num_tokens": 1841173.0,
|
|
"completions/mean_length": 167.375,
|
|
"completions/min_length": 67.0,
|
|
"completions/max_length": 275.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 167.375,
|
|
"completions/min_terminated_length": 67.0,
|
|
"completions/max_terminated_length": 275.0,
|
|
"tools/call_frequency": 3.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013328377157449722,
|
|
"sampling/sampling_logp_difference/max": 0.3578495979309082,
|
|
"sampling/importance_sampling_ratio/min": 0.4581547677516937,
|
|
"sampling/importance_sampling_ratio/mean": 1.0401952266693115,
|
|
"sampling/importance_sampling_ratio/max": 1.4747649431228638,
|
|
"entropy": 0.4210407976061106,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.5847341269254684,
|
|
"epoch": 0.007265625,
|
|
"step": 279
|
|
},
|
|
{
|
|
"loss": -0.03316352888941765,
|
|
"grad_norm": 5.062624931335449,
|
|
"learning_rate": 7.241379310344827e-08,
|
|
"num_tokens": 1847746.0,
|
|
"completions/mean_length": 136.125,
|
|
"completions/min_length": 70.0,
|
|
"completions/max_length": 310.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 136.125,
|
|
"completions/min_terminated_length": 70.0,
|
|
"completions/max_terminated_length": 310.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01335821021348238,
|
|
"sampling/sampling_logp_difference/max": 0.5180027484893799,
|
|
"sampling/importance_sampling_ratio/min": 0.3388051688671112,
|
|
"sampling/importance_sampling_ratio/mean": 0.8734016418457031,
|
|
"sampling/importance_sampling_ratio/max": 1.276824712753296,
|
|
"entropy": 0.39317552000284195,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.564523346722126,
|
|
"epoch": 0.007291666666666667,
|
|
"step": 280
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 6.89655172413793e-08,
|
|
"num_tokens": 1854049.0,
|
|
"completions/mean_length": 102.0,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 161.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 102.0,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 161.0,
|
|
"tools/call_frequency": 1.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01105661503970623,
|
|
"sampling/sampling_logp_difference/max": 0.2203744649887085,
|
|
"sampling/importance_sampling_ratio/min": 0.48088380694389343,
|
|
"sampling/importance_sampling_ratio/mean": 0.7941042184829712,
|
|
"sampling/importance_sampling_ratio/max": 1.3110313415527344,
|
|
"entropy": 0.3986786548048258,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 3.995740931481123,
|
|
"epoch": 0.007317708333333333,
|
|
"step": 281
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 6.551724137931034e-08,
|
|
"num_tokens": 1860582.0,
|
|
"completions/mean_length": 130.5,
|
|
"completions/min_length": 72.0,
|
|
"completions/max_length": 319.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 130.5,
|
|
"completions/min_terminated_length": 72.0,
|
|
"completions/max_terminated_length": 319.0,
|
|
"tools/call_frequency": 2.5,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012438568286597729,
|
|
"sampling/sampling_logp_difference/max": 0.30464017391204834,
|
|
"sampling/importance_sampling_ratio/min": 0.4535175561904907,
|
|
"sampling/importance_sampling_ratio/mean": 0.8174393177032471,
|
|
"sampling/importance_sampling_ratio/max": 1.0657907724380493,
|
|
"entropy": 0.38229982554912567,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.504117142409086,
|
|
"epoch": 0.00734375,
|
|
"step": 282
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 6.206896551724137e-08,
|
|
"num_tokens": 1866815.0,
|
|
"completions/mean_length": 93.5,
|
|
"completions/min_length": 72.0,
|
|
"completions/max_length": 140.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 93.5,
|
|
"completions/min_terminated_length": 72.0,
|
|
"completions/max_terminated_length": 140.0,
|
|
"tools/call_frequency": 1.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.012930222786962986,
|
|
"sampling/sampling_logp_difference/max": 0.33137255907058716,
|
|
"sampling/importance_sampling_ratio/min": 0.3496539890766144,
|
|
"sampling/importance_sampling_ratio/mean": 0.8376764059066772,
|
|
"sampling/importance_sampling_ratio/max": 1.1079111099243164,
|
|
"entropy": 0.3724994268268347,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 3.712655235081911,
|
|
"epoch": 0.007369791666666667,
|
|
"step": 283
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 5.862068965517241e-08,
|
|
"num_tokens": 1873045.0,
|
|
"completions/mean_length": 93.0,
|
|
"completions/min_length": 78.0,
|
|
"completions/max_length": 134.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 93.0,
|
|
"completions/min_terminated_length": 78.0,
|
|
"completions/max_terminated_length": 134.0,
|
|
"tools/call_frequency": 1.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01299613993614912,
|
|
"sampling/sampling_logp_difference/max": 0.5044503211975098,
|
|
"sampling/importance_sampling_ratio/min": 0.49159035086631775,
|
|
"sampling/importance_sampling_ratio/mean": 0.9234293103218079,
|
|
"sampling/importance_sampling_ratio/max": 1.193027138710022,
|
|
"entropy": 0.3958061747252941,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.465573392808437,
|
|
"epoch": 0.007395833333333333,
|
|
"step": 284
|
|
},
|
|
{
|
|
"loss": 0.39896079897880554,
|
|
"grad_norm": 15.04804515838623,
|
|
"learning_rate": 5.517241379310345e-08,
|
|
"num_tokens": 1879772.0,
|
|
"completions/mean_length": 154.375,
|
|
"completions/min_length": 75.0,
|
|
"completions/max_length": 246.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 154.375,
|
|
"completions/min_terminated_length": 75.0,
|
|
"completions/max_terminated_length": 246.0,
|
|
"tools/call_frequency": 3.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013603778555989265,
|
|
"sampling/sampling_logp_difference/max": 0.24956703186035156,
|
|
"sampling/importance_sampling_ratio/min": 0.26253074407577515,
|
|
"sampling/importance_sampling_ratio/mean": 0.8751516938209534,
|
|
"sampling/importance_sampling_ratio/max": 1.296643614768982,
|
|
"entropy": 0.45330972597002983,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.538145769387484,
|
|
"epoch": 0.007421875,
|
|
"step": 285
|
|
},
|
|
{
|
|
"loss": 0.07010338455438614,
|
|
"grad_norm": 5.517930030822754,
|
|
"learning_rate": 5.172413793103448e-08,
|
|
"num_tokens": 1886233.0,
|
|
"completions/mean_length": 121.375,
|
|
"completions/min_length": 76.0,
|
|
"completions/max_length": 206.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 121.375,
|
|
"completions/min_terminated_length": 76.0,
|
|
"completions/max_terminated_length": 206.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011033854447305202,
|
|
"sampling/sampling_logp_difference/max": 0.3105945587158203,
|
|
"sampling/importance_sampling_ratio/min": 0.449138879776001,
|
|
"sampling/importance_sampling_ratio/mean": 0.795243501663208,
|
|
"sampling/importance_sampling_ratio/max": 1.2061694860458374,
|
|
"entropy": 0.3942301273345947,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.420508563518524,
|
|
"epoch": 0.007447916666666667,
|
|
"step": 286
|
|
},
|
|
{
|
|
"loss": 0.178336501121521,
|
|
"grad_norm": 7.924858093261719,
|
|
"learning_rate": 4.827586206896551e-08,
|
|
"num_tokens": 1892752.0,
|
|
"completions/mean_length": 129.25,
|
|
"completions/min_length": 70.0,
|
|
"completions/max_length": 302.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 129.25,
|
|
"completions/min_terminated_length": 70.0,
|
|
"completions/max_terminated_length": 302.0,
|
|
"tools/call_frequency": 2.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.015458998270332813,
|
|
"sampling/sampling_logp_difference/max": 0.4543032646179199,
|
|
"sampling/importance_sampling_ratio/min": 0.4143412113189697,
|
|
"sampling/importance_sampling_ratio/mean": 0.8323342800140381,
|
|
"sampling/importance_sampling_ratio/max": 1.3250732421875,
|
|
"entropy": 0.3896496035158634,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.770214453339577,
|
|
"epoch": 0.007473958333333333,
|
|
"step": 287
|
|
},
|
|
{
|
|
"loss": 0.4996538758277893,
|
|
"grad_norm": 10.280075073242188,
|
|
"learning_rate": 4.482758620689655e-08,
|
|
"num_tokens": 1899561.0,
|
|
"completions/mean_length": 165.5,
|
|
"completions/min_length": 82.0,
|
|
"completions/max_length": 281.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 165.5,
|
|
"completions/min_terminated_length": 82.0,
|
|
"completions/max_terminated_length": 281.0,
|
|
"tools/call_frequency": 3.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.038750000298023224,
|
|
"rewards/reward_func/std": 0.015526475384831429,
|
|
"reward": 0.038750000298023224,
|
|
"reward_std": 0.015526475384831429,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013006397522985935,
|
|
"sampling/sampling_logp_difference/max": 0.3716449737548828,
|
|
"sampling/importance_sampling_ratio/min": 0.7561920285224915,
|
|
"sampling/importance_sampling_ratio/mean": 1.1260485649108887,
|
|
"sampling/importance_sampling_ratio/max": 1.7321792840957642,
|
|
"entropy": 0.4607531800866127,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.565570294857025,
|
|
"epoch": 0.0075,
|
|
"step": 288
|
|
},
|
|
{
|
|
"loss": 0.09880037605762482,
|
|
"grad_norm": 6.635493278503418,
|
|
"learning_rate": 4.1379310344827585e-08,
|
|
"num_tokens": 1906018.0,
|
|
"completions/mean_length": 121.125,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 268.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 121.125,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 268.0,
|
|
"tools/call_frequency": 2.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011291252449154854,
|
|
"sampling/sampling_logp_difference/max": 0.3563816547393799,
|
|
"sampling/importance_sampling_ratio/min": 0.46547731757164,
|
|
"sampling/importance_sampling_ratio/mean": 0.8630009889602661,
|
|
"sampling/importance_sampling_ratio/max": 1.3095393180847168,
|
|
"entropy": 0.3620409518480301,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.364994611591101,
|
|
"epoch": 0.007526041666666667,
|
|
"step": 289
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 3.793103448275862e-08,
|
|
"num_tokens": 1912313.0,
|
|
"completions/mean_length": 100.875,
|
|
"completions/min_length": 73.0,
|
|
"completions/max_length": 182.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 100.875,
|
|
"completions/min_terminated_length": 73.0,
|
|
"completions/max_terminated_length": 182.0,
|
|
"tools/call_frequency": 1.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011085974052548409,
|
|
"sampling/sampling_logp_difference/max": 0.2234964370727539,
|
|
"sampling/importance_sampling_ratio/min": 0.49764496088027954,
|
|
"sampling/importance_sampling_ratio/mean": 0.8203271627426147,
|
|
"sampling/importance_sampling_ratio/max": 1.1087837219238281,
|
|
"entropy": 0.3637619912624359,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 3.946752030402422,
|
|
"epoch": 0.007552083333333333,
|
|
"step": 290
|
|
},
|
|
{
|
|
"loss": 0.07282885909080505,
|
|
"grad_norm": 5.272033214569092,
|
|
"learning_rate": 3.448275862068965e-08,
|
|
"num_tokens": 1919160.0,
|
|
"completions/mean_length": 170.5,
|
|
"completions/min_length": 85.0,
|
|
"completions/max_length": 305.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 170.5,
|
|
"completions/min_terminated_length": 85.0,
|
|
"completions/max_terminated_length": 305.0,
|
|
"tools/call_frequency": 3.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.042500000447034836,
|
|
"rewards/reward_func/std": 0.01388730201870203,
|
|
"reward": 0.042500000447034836,
|
|
"reward_std": 0.013887301087379456,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.014097451232373714,
|
|
"sampling/sampling_logp_difference/max": 0.3057129383087158,
|
|
"sampling/importance_sampling_ratio/min": 0.4977567493915558,
|
|
"sampling/importance_sampling_ratio/mean": 0.8507600426673889,
|
|
"sampling/importance_sampling_ratio/max": 1.680345058441162,
|
|
"entropy": 0.5066847130656242,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.572480630129576,
|
|
"epoch": 0.007578125,
|
|
"step": 291
|
|
},
|
|
{
|
|
"loss": 0.47781217098236084,
|
|
"grad_norm": 14.663684844970703,
|
|
"learning_rate": 3.103448275862069e-08,
|
|
"num_tokens": 1925681.0,
|
|
"completions/mean_length": 129.25,
|
|
"completions/min_length": 82.0,
|
|
"completions/max_length": 233.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 129.25,
|
|
"completions/min_terminated_length": 82.0,
|
|
"completions/max_terminated_length": 233.0,
|
|
"tools/call_frequency": 2.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.009860091842710972,
|
|
"sampling/sampling_logp_difference/max": 0.22348833084106445,
|
|
"sampling/importance_sampling_ratio/min": 0.8452720046043396,
|
|
"sampling/importance_sampling_ratio/mean": 1.097581386566162,
|
|
"sampling/importance_sampling_ratio/max": 1.4050267934799194,
|
|
"entropy": 0.38677122443914413,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 5.255236741155386,
|
|
"epoch": 0.007604166666666667,
|
|
"step": 292
|
|
},
|
|
{
|
|
"loss": 0.14661124348640442,
|
|
"grad_norm": 7.916061878204346,
|
|
"learning_rate": 2.7586206896551723e-08,
|
|
"num_tokens": 1932155.0,
|
|
"completions/mean_length": 123.25,
|
|
"completions/min_length": 75.0,
|
|
"completions/max_length": 206.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 123.25,
|
|
"completions/min_terminated_length": 75.0,
|
|
"completions/max_terminated_length": 206.0,
|
|
"tools/call_frequency": 2.25,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010735097341239452,
|
|
"sampling/sampling_logp_difference/max": 0.22974944114685059,
|
|
"sampling/importance_sampling_ratio/min": 0.5868409276008606,
|
|
"sampling/importance_sampling_ratio/mean": 1.0919897556304932,
|
|
"sampling/importance_sampling_ratio/max": 1.6603084802627563,
|
|
"entropy": 0.3767926637083292,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.344409696757793,
|
|
"epoch": 0.0076302083333333335,
|
|
"step": 293
|
|
},
|
|
{
|
|
"loss": 0.11360034346580505,
|
|
"grad_norm": 5.1230340003967285,
|
|
"learning_rate": 2.4137931034482756e-08,
|
|
"num_tokens": 1939152.0,
|
|
"completions/mean_length": 188.25,
|
|
"completions/min_length": 70.0,
|
|
"completions/max_length": 277.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 188.25,
|
|
"completions/min_terminated_length": 70.0,
|
|
"completions/max_terminated_length": 277.0,
|
|
"tools/call_frequency": 4.125,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.03500000014901161,
|
|
"rewards/reward_func/std": 0.01603567600250244,
|
|
"reward": 0.03500000014901161,
|
|
"reward_std": 0.01603567600250244,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.0141568249091506,
|
|
"sampling/sampling_logp_difference/max": 0.2450413703918457,
|
|
"sampling/importance_sampling_ratio/min": 0.35865432024002075,
|
|
"sampling/importance_sampling_ratio/mean": 0.7781403064727783,
|
|
"sampling/importance_sampling_ratio/max": 1.0147700309753418,
|
|
"entropy": 0.4720127061009407,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.631839144974947,
|
|
"epoch": 0.00765625,
|
|
"step": 294
|
|
},
|
|
{
|
|
"loss": -0.10412270575761795,
|
|
"grad_norm": 5.538921356201172,
|
|
"learning_rate": 2.0689655172413793e-08,
|
|
"num_tokens": 1945744.0,
|
|
"completions/mean_length": 137.625,
|
|
"completions/min_length": 71.0,
|
|
"completions/max_length": 332.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 137.625,
|
|
"completions/min_terminated_length": 71.0,
|
|
"completions/max_terminated_length": 332.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.013937311246991158,
|
|
"sampling/sampling_logp_difference/max": 0.26548027992248535,
|
|
"sampling/importance_sampling_ratio/min": 0.3042404055595398,
|
|
"sampling/importance_sampling_ratio/mean": 0.9391204118728638,
|
|
"sampling/importance_sampling_ratio/max": 2.279909372329712,
|
|
"entropy": 0.3883692752569914,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.540512997657061,
|
|
"epoch": 0.007682291666666666,
|
|
"step": 295
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 1.7241379310344825e-08,
|
|
"num_tokens": 1952124.0,
|
|
"completions/mean_length": 111.75,
|
|
"completions/min_length": 76.0,
|
|
"completions/max_length": 172.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 111.75,
|
|
"completions/min_terminated_length": 76.0,
|
|
"completions/max_terminated_length": 172.0,
|
|
"tools/call_frequency": 1.75,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01113919261842966,
|
|
"sampling/sampling_logp_difference/max": 0.1757526397705078,
|
|
"sampling/importance_sampling_ratio/min": 0.6168844699859619,
|
|
"sampling/importance_sampling_ratio/mean": 1.0056668519973755,
|
|
"sampling/importance_sampling_ratio/max": 1.4122122526168823,
|
|
"entropy": 0.37877720408141613,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 3.899154383689165,
|
|
"epoch": 0.0077083333333333335,
|
|
"step": 296
|
|
},
|
|
{
|
|
"loss": 0.5456583499908447,
|
|
"grad_norm": 13.457406997680664,
|
|
"learning_rate": 1.3793103448275862e-08,
|
|
"num_tokens": 1958634.0,
|
|
"completions/mean_length": 127.25,
|
|
"completions/min_length": 66.0,
|
|
"completions/max_length": 322.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 127.25,
|
|
"completions/min_terminated_length": 66.0,
|
|
"completions/max_terminated_length": 322.0,
|
|
"tools/call_frequency": 2.0,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01348401140421629,
|
|
"sampling/sampling_logp_difference/max": 0.346210241317749,
|
|
"sampling/importance_sampling_ratio/min": 0.6471983790397644,
|
|
"sampling/importance_sampling_ratio/mean": 1.0347685813903809,
|
|
"sampling/importance_sampling_ratio/max": 1.5019745826721191,
|
|
"entropy": 0.3753661923110485,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.567156337201595,
|
|
"epoch": 0.007734375,
|
|
"step": 297
|
|
},
|
|
{
|
|
"loss": 0.22464537620544434,
|
|
"grad_norm": 7.81717586517334,
|
|
"learning_rate": 1.0344827586206896e-08,
|
|
"num_tokens": 1965176.0,
|
|
"completions/mean_length": 131.5,
|
|
"completions/min_length": 75.0,
|
|
"completions/max_length": 230.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 131.5,
|
|
"completions/min_terminated_length": 75.0,
|
|
"completions/max_terminated_length": 230.0,
|
|
"tools/call_frequency": 2.625,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.01140442956238985,
|
|
"sampling/sampling_logp_difference/max": 0.23350095748901367,
|
|
"sampling/importance_sampling_ratio/min": 0.6002361178398132,
|
|
"sampling/importance_sampling_ratio/mean": 1.01103675365448,
|
|
"sampling/importance_sampling_ratio/max": 1.6342579126358032,
|
|
"entropy": 0.3824719712138176,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.413738798350096,
|
|
"epoch": 0.007760416666666666,
|
|
"step": 298
|
|
},
|
|
{
|
|
"loss": 0.29455313086509705,
|
|
"grad_norm": 11.099472045898438,
|
|
"learning_rate": 6.896551724137931e-09,
|
|
"num_tokens": 1971725.0,
|
|
"completions/mean_length": 133.25,
|
|
"completions/min_length": 72.0,
|
|
"completions/max_length": 280.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 133.25,
|
|
"completions/min_terminated_length": 72.0,
|
|
"completions/max_terminated_length": 280.0,
|
|
"tools/call_frequency": 2.375,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.04625000059604645,
|
|
"rewards/reward_func/std": 0.010606602765619755,
|
|
"reward": 0.04625000059604645,
|
|
"reward_std": 0.01060660183429718,
|
|
"frac_reward_zero_std": 0.0,
|
|
"sampling/sampling_logp_difference/mean": 0.011876091361045837,
|
|
"sampling/sampling_logp_difference/max": 0.2500345706939697,
|
|
"sampling/importance_sampling_ratio/min": 0.6783010959625244,
|
|
"sampling/importance_sampling_ratio/mean": 1.0316640138626099,
|
|
"sampling/importance_sampling_ratio/max": 1.4536182880401611,
|
|
"entropy": 0.39311898685991764,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.447130784392357,
|
|
"epoch": 0.007786458333333334,
|
|
"step": 299
|
|
},
|
|
{
|
|
"loss": 0.0,
|
|
"grad_norm": 0.0,
|
|
"learning_rate": 3.4482758620689654e-09,
|
|
"num_tokens": 1978122.0,
|
|
"completions/mean_length": 114.375,
|
|
"completions/min_length": 79.0,
|
|
"completions/max_length": 198.0,
|
|
"completions/clipped_ratio": 0.0,
|
|
"completions/mean_terminated_length": 114.375,
|
|
"completions/min_terminated_length": 79.0,
|
|
"completions/max_terminated_length": 198.0,
|
|
"tools/call_frequency": 1.875,
|
|
"tools/failure_frequency": 0.0,
|
|
"rewards/reward_func/mean": 0.05000000074505806,
|
|
"rewards/reward_func/std": 0.0,
|
|
"reward": 0.05000000074505806,
|
|
"reward_std": 0.0,
|
|
"frac_reward_zero_std": 1.0,
|
|
"sampling/sampling_logp_difference/mean": 0.010921039618551731,
|
|
"sampling/sampling_logp_difference/max": 0.31644201278686523,
|
|
"sampling/importance_sampling_ratio/min": 0.5520099401473999,
|
|
"sampling/importance_sampling_ratio/mean": 0.9209573864936829,
|
|
"sampling/importance_sampling_ratio/max": 1.5878106355667114,
|
|
"entropy": 0.390807431191206,
|
|
"clip_ratio/low_mean": 0.0,
|
|
"clip_ratio/low_min": 0.0,
|
|
"clip_ratio/high_mean": 0.0,
|
|
"clip_ratio/high_max": 0.0,
|
|
"clip_ratio/region_mean": 0.0,
|
|
"step_time": 4.919507894665003,
|
|
"epoch": 0.0078125,
|
|
"step": 300
|
|
},
|
|
{
|
|
"train_runtime": 2281.1679,
|
|
"train_samples_per_second": 1.052,
|
|
"train_steps_per_second": 0.132,
|
|
"total_flos": 0.0,
|
|
"train_loss": 0.20039798735951384,
|
|
"epoch": 0.0078125,
|
|
"step": 300
|
|
}
|
|
] |