Files
qwen3-8b-ronpo-konly-s42/trainer_state.json
ModelHub XC bf2af79f62 初始化项目,由ModelHub XC社区提供模型
Model: promotion/qwen3-8b-ronpo-konly-s42
Source: Original Platform
2026-08-05 01:11:17 +08:00

1013 lines
35 KiB
JSON

{
"best_global_step": 437,
"best_metric": 0.35658061504364014,
"best_model_checkpoint": "/NHNHOME/WORKSPACE/26msit001_A/mnpo/revision_qwen3_8b/full_iter1/train/ronpo_k_only_s42_nhn-b200-q3-seq-07101430-konly/checkpoint-437",
"epoch": 1.0,
"eval_steps": 500,
"global_step": 437,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.02288329519450801,
"grad_norm": 507.4701728682287,
"learning_rate": 1.0227272727272728e-07,
"logits/chosen": -0.79296875,
"logits/rejected": -0.82421875,
"logps/chosen": -15.875,
"logps/rejected": -15.8125,
"loss": 0.7230703234672546,
"rewards/accuracies": 0.5375000238418579,
"rewards/chosen": -153.16549682617188,
"rewards/margins": 1.1008796691894531,
"rewards/rejected": -154.26638793945312,
"ronpo/logit": 0.11004491150379181,
"ronpo/residual": 0.09169502556324005,
"ronpo/residual_abs": 0.4952625334262848,
"ronpo/target": 0.018349889665842056,
"ronpo/target_abs": 0.26459527015686035,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 10
},
{
"epoch": 0.04576659038901602,
"grad_norm": 336.7714258925431,
"learning_rate": 2.159090909090909e-07,
"logits/chosen": -0.82421875,
"logits/rejected": -0.82421875,
"logps/chosen": -15.875,
"logps/rejected": -15.9375,
"loss": 0.6306931376457214,
"rewards/accuracies": 0.612500011920929,
"rewards/chosen": -153.71337890625,
"rewards/margins": 1.7559814453125,
"rewards/rejected": -155.4693603515625,
"ronpo/logit": 0.1755521446466446,
"ronpo/residual": 0.1825995147228241,
"ronpo/residual_abs": 0.4917503297328949,
"ronpo/target": -0.0070473672822117805,
"ronpo/target_abs": 0.2585894465446472,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 20
},
{
"epoch": 0.06864988558352403,
"grad_norm": 179.93401054763783,
"learning_rate": 3.295454545454545e-07,
"logits/chosen": -0.83984375,
"logits/rejected": -0.8203125,
"logps/chosen": -15.8125,
"logps/rejected": -15.875,
"loss": 0.7665756940841675,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": -152.2275390625,
"rewards/margins": 2.1743698120117188,
"rewards/rejected": -154.4019012451172,
"ronpo/logit": 0.21744287014007568,
"ronpo/residual": 0.21943974494934082,
"ronpo/residual_abs": 0.5555931925773621,
"ronpo/target": -0.0019968985579907894,
"ronpo/target_abs": 0.23704366385936737,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 30
},
{
"epoch": 0.09153318077803203,
"grad_norm": 188.32242349357378,
"learning_rate": 4.4318181818181817e-07,
"logits/chosen": -0.8515625,
"logits/rejected": -0.84375,
"logps/chosen": -15.75,
"logps/rejected": -15.8125,
"loss": 0.5709580183029175,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": -152.11019897460938,
"rewards/margins": 1.608306884765625,
"rewards/rejected": -153.718505859375,
"ronpo/logit": 0.16085514426231384,
"ronpo/residual": 0.1310609132051468,
"ronpo/residual_abs": 0.4952216148376465,
"ronpo/target": 0.02979421615600586,
"ronpo/target_abs": 0.24758920073509216,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 40
},
{
"epoch": 0.11441647597254005,
"grad_norm": 178.24231576952798,
"learning_rate": 4.998003327445819e-07,
"logits/chosen": -0.83984375,
"logits/rejected": -0.86328125,
"logps/chosen": -15.625,
"logps/rejected": -15.6875,
"loss": 0.49001631140708923,
"rewards/accuracies": 0.643750011920929,
"rewards/chosen": -151.10308837890625,
"rewards/margins": 1.7249259948730469,
"rewards/rejected": -152.8280029296875,
"ronpo/logit": 0.17246504127979279,
"ronpo/residual": 0.14314237236976624,
"ronpo/residual_abs": 0.4705863893032074,
"ronpo/target": 0.02932267263531685,
"ronpo/target_abs": 0.24458365142345428,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 50
},
{
"epoch": 0.13729977116704806,
"grad_norm": 189.3688920695095,
"learning_rate": 4.98204907808407e-07,
"logits/chosen": -0.9296875,
"logits/rejected": -0.93359375,
"logps/chosen": -15.1875,
"logps/rejected": -15.1875,
"loss": 1.0039470195770264,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": -146.05941772460938,
"rewards/margins": 1.8618888854980469,
"rewards/rejected": -147.9213104248047,
"ronpo/logit": 0.1862778663635254,
"ronpo/residual": 0.19359330832958221,
"ronpo/residual_abs": 0.5423773527145386,
"ronpo/target": -0.007315444760024548,
"ronpo/target_abs": 0.25545692443847656,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 60
},
{
"epoch": 0.16018306636155608,
"grad_norm": 221.19383431375573,
"learning_rate": 4.95024247597132e-07,
"logits/chosen": -1.0078125,
"logits/rejected": -1.0078125,
"logps/chosen": -14.8125,
"logps/rejected": -14.8125,
"loss": 0.5034725069999695,
"rewards/accuracies": 0.59375,
"rewards/chosen": -142.9036102294922,
"rewards/margins": 1.5878067016601562,
"rewards/rejected": -144.49142456054688,
"ronpo/logit": 0.15876074135303497,
"ronpo/residual": 0.16019420325756073,
"ronpo/residual_abs": 0.4973166882991791,
"ronpo/target": -0.00143346784170717,
"ronpo/target_abs": 0.2591482996940613,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 70
},
{
"epoch": 0.18306636155606407,
"grad_norm": 166.72773225533953,
"learning_rate": 4.902786663535712e-07,
"logits/chosen": -1.0078125,
"logits/rejected": -1.0234375,
"logps/chosen": -14.4375,
"logps/rejected": -14.375,
"loss": 0.5039559602737427,
"rewards/accuracies": 0.5375000238418579,
"rewards/chosen": -139.4639129638672,
"rewards/margins": 0.5908203125,
"rewards/rejected": -140.0547332763672,
"ronpo/logit": 0.05916024371981621,
"ronpo/residual": 0.07047247886657715,
"ronpo/residual_abs": 0.45131802558898926,
"ronpo/target": -0.011312246322631836,
"ronpo/target_abs": 0.26929640769958496,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 80
},
{
"epoch": 0.20594965675057209,
"grad_norm": 224.52627431026863,
"learning_rate": 4.8399847315926e-07,
"logits/chosen": -1.015625,
"logits/rejected": -1.0234375,
"logps/chosen": -14.1875,
"logps/rejected": -14.125,
"loss": 1.0758483409881592,
"rewards/accuracies": 0.5874999761581421,
"rewards/chosen": -134.73431396484375,
"rewards/margins": 2.2587051391601562,
"rewards/rejected": -136.99301147460938,
"ronpo/logit": 0.225923091173172,
"ronpo/residual": 0.21176382899284363,
"ronpo/residual_abs": 0.5388052463531494,
"ronpo/target": 0.0141592500731349,
"ronpo/target_abs": 0.24621061980724335,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 90
},
{
"epoch": 0.2288329519450801,
"grad_norm": 193.7153670572699,
"learning_rate": 4.762237783563906e-07,
"logits/chosen": -0.99609375,
"logits/rejected": -1.0078125,
"logps/chosen": -13.875,
"logps/rejected": -13.8125,
"loss": 0.507349967956543,
"rewards/accuracies": 0.53125,
"rewards/chosen": -133.3758544921875,
"rewards/margins": 1.0252304077148438,
"rewards/rejected": -134.40109252929688,
"ronpo/logit": 0.10251834243535995,
"ronpo/residual": 0.09443376958370209,
"ronpo/residual_abs": 0.43109574913978577,
"ronpo/target": 0.008084583096206188,
"ronpo/target_abs": 0.2518351674079895,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 100
},
{
"epoch": 0.2517162471395881,
"grad_norm": 162.81045220693468,
"learning_rate": 4.670042373710523e-07,
"logits/chosen": -1.0078125,
"logits/rejected": -1.0,
"logps/chosen": -13.6875,
"logps/rejected": -13.625,
"loss": 1.1557821035385132,
"rewards/accuracies": 0.581250011920929,
"rewards/chosen": -130.3563232421875,
"rewards/margins": 2.2956924438476562,
"rewards/rejected": -132.65200805664062,
"ronpo/logit": 0.22950632870197296,
"ronpo/residual": 0.2178325206041336,
"ronpo/residual_abs": 0.5105395913124084,
"ronpo/target": 0.011673808097839355,
"ronpo/target_abs": 0.24373772740364075,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 110
},
{
"epoch": 0.2745995423340961,
"grad_norm": 188.78038929481818,
"learning_rate": 4.5639873357392157e-07,
"logits/chosen": -0.97265625,
"logits/rejected": -0.95703125,
"logps/chosen": -13.375,
"logps/rejected": -13.4375,
"loss": 0.47604840993881226,
"rewards/accuracies": 0.612500011920929,
"rewards/chosen": -128.6849365234375,
"rewards/margins": 1.71466064453125,
"rewards/rejected": -130.3996124267578,
"ronpo/logit": 0.17151877284049988,
"ronpo/residual": 0.1699337661266327,
"ronpo/residual_abs": 0.4403519630432129,
"ronpo/target": 0.0015850067138671875,
"ronpo/target_abs": 0.25699958205223083,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 120
},
{
"epoch": 0.2974828375286041,
"grad_norm": 34.783846491386534,
"learning_rate": 4.444750022039099e-07,
"logits/chosen": -0.92578125,
"logits/rejected": -0.9453125,
"logps/chosen": -13.375,
"logps/rejected": -13.375,
"loss": 0.4631749093532562,
"rewards/accuracies": 0.606249988079071,
"rewards/chosen": -128.41290283203125,
"rewards/margins": 1.4823760986328125,
"rewards/rejected": -129.89527893066406,
"ronpo/logit": 0.1482272893190384,
"ronpo/residual": 0.13759438693523407,
"ronpo/residual_abs": 0.41783371567726135,
"ronpo/target": 0.010632896795868874,
"ronpo/target_abs": 0.2536512315273285,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 130
},
{
"epoch": 0.32036613272311215,
"grad_norm": 66.75154575107938,
"learning_rate": 4.313091977566937e-07,
"logits/chosen": -0.90625,
"logits/rejected": -0.921875,
"logps/chosen": -13.3125,
"logps/rejected": -13.25,
"loss": 0.7874235510826111,
"rewards/accuracies": 0.612500011920929,
"rewards/chosen": -126.31758880615234,
"rewards/margins": 2.0760345458984375,
"rewards/rejected": -128.3936309814453,
"ronpo/logit": 0.20748524367809296,
"ronpo/residual": 0.20403257012367249,
"ronpo/residual_abs": 0.4981064796447754,
"ronpo/target": 0.00345268240198493,
"ronpo/target_abs": 0.2723880708217621,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 140
},
{
"epoch": 0.34324942791762014,
"grad_norm": 192.9229979776684,
"learning_rate": 4.169854076011292e-07,
"logits/chosen": -0.86328125,
"logits/rejected": -0.87109375,
"logps/chosen": -13.25,
"logps/rejected": -13.3125,
"loss": 0.2791599631309509,
"rewards/accuracies": 0.612500011920929,
"rewards/chosen": -127.51309967041016,
"rewards/margins": 1.3698883056640625,
"rewards/rejected": -128.8829803466797,
"ronpo/logit": 0.1369936764240265,
"ronpo/residual": 0.14234663546085358,
"ronpo/residual_abs": 0.39549511671066284,
"ronpo/target": -0.005352973937988281,
"ronpo/target_abs": 0.276210218667984,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 150
},
{
"epoch": 0.36613272311212813,
"grad_norm": 34.9536433242253,
"learning_rate": 4.0159511492998744e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.8515625,
"logps/chosen": -13.1875,
"logps/rejected": -13.125,
"loss": 0.3614216148853302,
"rewards/accuracies": 0.625,
"rewards/chosen": -126.5057144165039,
"rewards/margins": 1.162130355834961,
"rewards/rejected": -127.66786193847656,
"ronpo/logit": 0.11622162908315659,
"ronpo/residual": 0.15131323039531708,
"ronpo/residual_abs": 0.3710349202156067,
"ronpo/target": -0.0350915901362896,
"ronpo/target_abs": 0.25014859437942505,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 160
},
{
"epoch": 0.3890160183066362,
"grad_norm": 42.22385969745458,
"learning_rate": 3.8523661447503574e-07,
"logits/chosen": -0.83203125,
"logits/rejected": -0.828125,
"logps/chosen": -13.3125,
"logps/rejected": -13.25,
"loss": 0.21069881319999695,
"rewards/accuracies": 0.606249988079071,
"rewards/chosen": -127.7530517578125,
"rewards/margins": 0.88427734375,
"rewards/rejected": -128.6373291015625,
"ronpo/logit": 0.08846603333950043,
"ronpo/residual": 0.06841827929019928,
"ronpo/residual_abs": 0.35050949454307556,
"ronpo/target": 0.020047759637236595,
"ronpo/target_abs": 0.2535446286201477,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 170
},
{
"epoch": 0.41189931350114417,
"grad_norm": 72.12426453546038,
"learning_rate": 3.6801438471817826e-07,
"logits/chosen": -0.77734375,
"logits/rejected": -0.7578125,
"logps/chosen": -13.25,
"logps/rejected": -13.25,
"loss": 0.5257893800735474,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": -127.363037109375,
"rewards/margins": 1.278564453125,
"rewards/rejected": -128.6416015625,
"ronpo/logit": 0.12785287201404572,
"ronpo/residual": 0.14572112262248993,
"ronpo/residual_abs": 0.3929472267627716,
"ronpo/target": -0.01786825619637966,
"ronpo/target_abs": 0.272230327129364,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 180
},
{
"epoch": 0.43478260869565216,
"grad_norm": 48.4203371563711,
"learning_rate": 3.5003842060821546e-07,
"logits/chosen": -0.70703125,
"logits/rejected": -0.703125,
"logps/chosen": -13.375,
"logps/rejected": -13.3125,
"loss": 0.4416274428367615,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": -128.242431640625,
"rewards/margins": 1.3032684326171875,
"rewards/rejected": -129.5457000732422,
"ronpo/logit": 0.13027086853981018,
"ronpo/residual": 0.13186077773571014,
"ronpo/residual_abs": 0.40120625495910645,
"ronpo/target": -0.0015898942947387695,
"ronpo/target_abs": 0.26229482889175415,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 190
},
{
"epoch": 0.4576659038901602,
"grad_norm": 32.19528363036125,
"learning_rate": 3.3142353104503053e-07,
"logits/chosen": -0.6328125,
"logits/rejected": -0.6328125,
"logps/chosen": -13.4375,
"logps/rejected": -13.5,
"loss": 0.4198226034641266,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": -128.51138305664062,
"rewards/margins": 1.9074668884277344,
"rewards/rejected": -130.41885375976562,
"ronpo/logit": 0.19083575904369354,
"ronpo/residual": 0.2115732729434967,
"ronpo/residual_abs": 0.41171345114707947,
"ronpo/target": -0.020737504586577415,
"ronpo/target_abs": 0.24886098504066467,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 200
},
{
"epoch": 0.4805491990846682,
"grad_norm": 57.99776711568966,
"learning_rate": 3.122886056180284e-07,
"logits/chosen": -0.6015625,
"logits/rejected": -0.59375,
"logps/chosen": -13.5,
"logps/rejected": -13.5,
"loss": 0.5668808221817017,
"rewards/accuracies": 0.6187499761581421,
"rewards/chosen": -128.95379638671875,
"rewards/margins": 2.156829833984375,
"rewards/rejected": -131.11062622070312,
"ronpo/logit": 0.21571657061576843,
"ronpo/residual": 0.2658722400665283,
"ronpo/residual_abs": 0.4744180738925934,
"ronpo/target": -0.0501556396484375,
"ronpo/target_abs": 0.26495361328125,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 210
},
{
"epoch": 0.5034324942791762,
"grad_norm": 66.5748797349874,
"learning_rate": 2.927558552820251e-07,
"logits/chosen": -0.57421875,
"logits/rejected": -0.56640625,
"logps/chosen": -13.5625,
"logps/rejected": -13.5625,
"loss": 0.8348878622055054,
"rewards/accuracies": 0.5687500238418579,
"rewards/chosen": -129.84304809570312,
"rewards/margins": 1.874420166015625,
"rewards/rejected": -131.71746826171875,
"ronpo/logit": 0.18745450675487518,
"ronpo/residual": 0.18469519913196564,
"ronpo/residual_abs": 0.4471713602542877,
"ronpo/target": 0.002759313676506281,
"ronpo/target_abs": 0.27416548132896423,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 220
},
{
"epoch": 0.5263157894736842,
"grad_norm": 59.64590279351556,
"learning_rate": 2.729500318202379e-07,
"logits/chosen": -0.5625,
"logits/rejected": -0.5703125,
"logps/chosen": -13.625,
"logps/rejected": -13.5625,
"loss": 1.0018385648727417,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": -129.21832275390625,
"rewards/margins": 2.456756591796875,
"rewards/rejected": -131.67507934570312,
"ronpo/logit": 0.24569907784461975,
"ronpo/residual": 0.2502497136592865,
"ronpo/residual_abs": 0.5137172937393188,
"ronpo/target": -0.004550647921860218,
"ronpo/target_abs": 0.25031614303588867,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 230
},
{
"epoch": 0.5491990846681922,
"grad_norm": 53.78348871569346,
"learning_rate": 2.5299763107951076e-07,
"logits/chosen": -0.5859375,
"logits/rejected": -0.58203125,
"logps/chosen": -13.625,
"logps/rejected": -13.625,
"loss": 0.45406943559646606,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": -129.8865966796875,
"rewards/margins": 1.919342041015625,
"rewards/rejected": -131.80593872070312,
"ronpo/logit": 0.19197313487529755,
"ronpo/residual": 0.2080519199371338,
"ronpo/residual_abs": 0.4232204556465149,
"ronpo/target": -0.016078775748610497,
"ronpo/target_abs": 0.2563047707080841,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 240
},
{
"epoch": 0.5720823798627003,
"grad_norm": 314.6485896661544,
"learning_rate": 2.3302608506655286e-07,
"logits/chosen": -0.55859375,
"logits/rejected": -0.5625,
"logps/chosen": -13.5,
"logps/rejected": -13.5625,
"loss": 0.3197762072086334,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": -130.083740234375,
"rewards/margins": 1.003997802734375,
"rewards/rejected": -131.08773803710938,
"ronpo/logit": 0.10035202652215958,
"ronpo/residual": 0.09121748805046082,
"ronpo/residual_abs": 0.37010660767555237,
"ronpo/target": 0.009134531021118164,
"ronpo/target_abs": 0.26355957984924316,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 250
},
{
"epoch": 0.5949656750572082,
"grad_norm": 68.55328552753093,
"learning_rate": 2.131629480651116e-07,
"logits/chosen": -0.55078125,
"logits/rejected": -0.55078125,
"logps/chosen": -13.625,
"logps/rejected": -13.5625,
"loss": 0.2595209777355194,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": -130.5323486328125,
"rewards/margins": 1.3940658569335938,
"rewards/rejected": -131.92642211914062,
"ronpo/logit": 0.13951639831066132,
"ronpo/residual": 0.16778139770030975,
"ronpo/residual_abs": 0.3852796256542206,
"ronpo/target": -0.028264999389648438,
"ronpo/target_abs": 0.2798442840576172,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 260
},
{
"epoch": 0.6178489702517163,
"grad_norm": 90.54243633746498,
"learning_rate": 1.935350819721849e-07,
"logits/chosen": -0.51953125,
"logits/rejected": -0.5234375,
"logps/chosen": -13.625,
"logps/rejected": -13.625,
"loss": 0.41456565260887146,
"rewards/accuracies": 0.5874999761581421,
"rewards/chosen": -130.73831176757812,
"rewards/margins": 1.3446502685546875,
"rewards/rejected": -132.0829620361328,
"ronpo/logit": 0.134442999958992,
"ronpo/residual": 0.09629812836647034,
"ronpo/residual_abs": 0.38442301750183105,
"ronpo/target": 0.038144875317811966,
"ronpo/target_abs": 0.23953285813331604,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 270
},
{
"epoch": 0.6407322654462243,
"grad_norm": 91.49025424779988,
"learning_rate": 1.742678460563715e-07,
"logits/chosen": -0.498046875,
"logits/rejected": -0.5078125,
"logps/chosen": -13.6875,
"logps/rejected": -13.6875,
"loss": 0.7765046954154968,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": -130.361572265625,
"rewards/margins": 2.2234344482421875,
"rewards/rejected": -132.5850067138672,
"ronpo/logit": 0.22241516411304474,
"ronpo/residual": 0.19911065697669983,
"ronpo/residual_abs": 0.44603413343429565,
"ronpo/target": 0.023304533213377,
"ronpo/target_abs": 0.26094645261764526,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 280
},
{
"epoch": 0.6636155606407322,
"grad_norm": 120.63542765790571,
"learning_rate": 1.5548429631320804e-07,
"logits/chosen": -0.50390625,
"logits/rejected": -0.50390625,
"logps/chosen": -13.6875,
"logps/rejected": -13.6875,
"loss": 0.6691421270370483,
"rewards/accuracies": 0.59375,
"rewards/chosen": -130.86163330078125,
"rewards/margins": 1.9347991943359375,
"rewards/rejected": -132.7964324951172,
"ronpo/logit": 0.1935712993144989,
"ronpo/residual": 0.19426050782203674,
"ronpo/residual_abs": 0.464620977640152,
"ronpo/target": -0.0006892204401083291,
"ronpo/target_abs": 0.25403547286987305,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 290
},
{
"epoch": 0.6864988558352403,
"grad_norm": 55.729121734986606,
"learning_rate": 1.373043995310524e-07,
"logits/chosen": -0.490234375,
"logits/rejected": -0.482421875,
"logps/chosen": -13.6875,
"logps/rejected": -13.625,
"loss": 0.6174883842468262,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": -130.33990478515625,
"rewards/margins": 2.029083251953125,
"rewards/rejected": -132.36898803710938,
"ronpo/logit": 0.20279976725578308,
"ronpo/residual": 0.20034602284431458,
"ronpo/residual_abs": 0.43287530541419983,
"ronpo/target": 0.0024537325371056795,
"ronpo/target_abs": 0.24373027682304382,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 300
},
{
"epoch": 0.7093821510297483,
"grad_norm": 31.586368551140392,
"learning_rate": 1.1984426708711804e-07,
"logits/chosen": -0.50390625,
"logits/rejected": -0.49609375,
"logps/chosen": -13.5625,
"logps/rejected": -13.5625,
"loss": 0.26410332322120667,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": -130.807373046875,
"rewards/margins": 1.055145263671875,
"rewards/rejected": -131.86251831054688,
"ronpo/logit": 0.10549856722354889,
"ronpo/residual": 0.14673687517642975,
"ronpo/residual_abs": 0.3895283341407776,
"ronpo/target": -0.04123830795288086,
"ronpo/target_abs": 0.2849213480949402,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 310
},
{
"epoch": 0.7322654462242563,
"grad_norm": 41.977465977771885,
"learning_rate": 1.0321541336725026e-07,
"logits/chosen": -0.498046875,
"logits/rejected": -0.5,
"logps/chosen": -13.625,
"logps/rejected": -13.625,
"loss": 0.39825934171676636,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": -130.84564208984375,
"rewards/margins": 1.891153335571289,
"rewards/rejected": -132.73678588867188,
"ronpo/logit": 0.1891597956418991,
"ronpo/residual": 0.19329676032066345,
"ronpo/residual_abs": 0.38093996047973633,
"ronpo/target": -0.004136943724006414,
"ronpo/target_abs": 0.2447056770324707,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 320
},
{
"epoch": 0.7551487414187643,
"grad_norm": 97.11696106748332,
"learning_rate": 8.75240435457705e-08,
"logits/chosen": -0.5,
"logits/rejected": -0.494140625,
"logps/chosen": -13.625,
"logps/rejected": -13.625,
"loss": 0.40726518630981445,
"rewards/accuracies": 0.606249988079071,
"rewards/chosen": -130.62158203125,
"rewards/margins": 1.356597900390625,
"rewards/rejected": -131.97817993164062,
"ronpo/logit": 0.1355902999639511,
"ronpo/residual": 0.13591110706329346,
"ronpo/residual_abs": 0.4075256884098053,
"ronpo/target": -0.0003208100679330528,
"ronpo/target_abs": 0.2613794803619385,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 330
},
{
"epoch": 0.7780320366132724,
"grad_norm": 16.556229911254658,
"learning_rate": 7.287037527419604e-08,
"logits/chosen": -0.51171875,
"logits/rejected": -0.5078125,
"logps/chosen": -13.6875,
"logps/rejected": -13.75,
"loss": 1.1543911695480347,
"rewards/accuracies": 0.71875,
"rewards/chosen": -130.10595703125,
"rewards/margins": 2.9382247924804688,
"rewards/rejected": -133.044189453125,
"ronpo/logit": 0.2938784062862396,
"ronpo/residual": 0.28921040892601013,
"ronpo/residual_abs": 0.4960741102695465,
"ronpo/target": 0.004667997360229492,
"ronpo/target_abs": 0.26037946343421936,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 340
},
{
"epoch": 0.8009153318077803,
"grad_norm": 49.66277733374995,
"learning_rate": 5.934799861107506e-08,
"logits/chosen": -0.490234375,
"logits/rejected": -0.50390625,
"logps/chosen": -13.5625,
"logps/rejected": -13.5625,
"loss": 0.2971951365470886,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": -130.4481201171875,
"rewards/margins": 0.9669418334960938,
"rewards/rejected": -131.41506958007812,
"ronpo/logit": 0.09669926017522812,
"ronpo/residual": 0.08134034276008606,
"ronpo/residual_abs": 0.3665750324726105,
"ronpo/target": 0.015358924865722656,
"ronpo/target_abs": 0.2653478682041168,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 350
},
{
"epoch": 0.8237986270022883,
"grad_norm": 31.948876313907636,
"learning_rate": 4.7043278280936406e-08,
"logits/chosen": -0.51171875,
"logits/rejected": -0.51171875,
"logps/chosen": -13.5,
"logps/rejected": -13.5625,
"loss": 0.27478647232055664,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": -130.006591796875,
"rewards/margins": 1.4485015869140625,
"rewards/rejected": -131.45510864257812,
"ronpo/logit": 0.14487479627132416,
"ronpo/residual": 0.18561749160289764,
"ronpo/residual_abs": 0.3878316283226013,
"ronpo/target": -0.04074268415570259,
"ronpo/target_abs": 0.23417606949806213,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 360
},
{
"epoch": 0.8466819221967964,
"grad_norm": 69.93387749352912,
"learning_rate": 3.603480208000781e-08,
"logits/chosen": -0.48828125,
"logits/rejected": -0.484375,
"logps/chosen": -13.625,
"logps/rejected": -13.625,
"loss": 0.4619961380958557,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": -130.478759765625,
"rewards/margins": 1.3962898254394531,
"rewards/rejected": -131.8750457763672,
"ronpo/logit": 0.13958875834941864,
"ronpo/residual": 0.1094854325056076,
"ronpo/residual_abs": 0.4327429234981537,
"ronpo/target": 0.030103301629424095,
"ronpo/target_abs": 0.2981323301792145,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 370
},
{
"epoch": 0.8695652173913043,
"grad_norm": 82.61470418012827,
"learning_rate": 2.6392878951625258e-08,
"logits/chosen": -0.470703125,
"logits/rejected": -0.486328125,
"logps/chosen": -13.625,
"logps/rejected": -13.625,
"loss": 0.6330326795578003,
"rewards/accuracies": 0.606249988079071,
"rewards/chosen": -131.38787841796875,
"rewards/margins": 0.8808364868164062,
"rewards/rejected": -132.2687225341797,
"ronpo/logit": 0.08816994726657867,
"ronpo/residual": 0.10562714189291,
"ronpo/residual_abs": 0.4062245786190033,
"ronpo/target": -0.017457198351621628,
"ronpo/target_abs": 0.28133049607276917,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 380
},
{
"epoch": 0.8924485125858124,
"grad_norm": 29.76910596480733,
"learning_rate": 1.8179089937025548e-08,
"logits/chosen": -0.50390625,
"logits/rejected": -0.50390625,
"logps/chosen": -13.5625,
"logps/rejected": -13.5,
"loss": 0.20862670242786407,
"rewards/accuracies": 0.5562499761581421,
"rewards/chosen": -130.48080444335938,
"rewards/margins": 0.68048095703125,
"rewards/rejected": -131.16128540039062,
"ronpo/logit": 0.06805794686079025,
"ronpo/residual": 0.07399886846542358,
"ronpo/residual_abs": 0.34743252396583557,
"ronpo/target": -0.005940929055213928,
"ronpo/target_abs": 0.2420380562543869,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 390
},
{
"epoch": 0.9153318077803204,
"grad_norm": 66.83030388275304,
"learning_rate": 1.1445894869509865e-08,
"logits/chosen": -0.5,
"logits/rejected": -0.5,
"logps/chosen": -13.5625,
"logps/rejected": -13.5625,
"loss": 0.617999255657196,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": -130.7327423095703,
"rewards/margins": 1.04730224609375,
"rewards/rejected": -131.78004455566406,
"ronpo/logit": 0.10468678176403046,
"ronpo/residual": 0.07548566162586212,
"ronpo/residual_abs": 0.38671615719795227,
"ronpo/target": 0.029201125726103783,
"ronpo/target_abs": 0.2588233947753906,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 400
},
{
"epoch": 0.9382151029748284,
"grad_norm": 22.540093716859946,
"learning_rate": 6.2362973239446785e-09,
"logits/chosen": -0.50390625,
"logits/rejected": -0.50390625,
"logps/chosen": -13.6875,
"logps/rejected": -13.6875,
"loss": 0.688459038734436,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": -129.91021728515625,
"rewards/margins": 2.6958179473876953,
"rewards/rejected": -132.6060333251953,
"ronpo/logit": 0.2695961594581604,
"ronpo/residual": 0.24798472225666046,
"ronpo/residual_abs": 0.48190993070602417,
"ronpo/target": 0.021611403673887253,
"ronpo/target_abs": 0.27506598830223083,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 410
},
{
"epoch": 0.9610983981693364,
"grad_norm": 31.14712184561151,
"learning_rate": 2.583569961500276e-09,
"logits/chosen": -0.48046875,
"logits/rejected": -0.478515625,
"logps/chosen": -13.6875,
"logps/rejected": -13.625,
"loss": 0.5411345362663269,
"rewards/accuracies": 0.606249988079071,
"rewards/chosen": -129.72723388671875,
"rewards/margins": 1.803375244140625,
"rewards/rejected": -131.53060913085938,
"ronpo/logit": 0.18028709292411804,
"ronpo/residual": 0.17998413741588593,
"ronpo/residual_abs": 0.43158477544784546,
"ronpo/target": 0.0003029584768228233,
"ronpo/target_abs": 0.2634728252887726,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 420
},
{
"epoch": 0.9839816933638444,
"grad_norm": 37.17749009315313,
"learning_rate": 5.110420237955382e-10,
"logits/chosen": -0.515625,
"logits/rejected": -0.5078125,
"logps/chosen": -13.625,
"logps/rejected": -13.625,
"loss": 0.559510350227356,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": -129.8929443359375,
"rewards/margins": 2.22955322265625,
"rewards/rejected": -132.12249755859375,
"ronpo/logit": 0.22305068373680115,
"ronpo/residual": 0.23500566184520721,
"ronpo/residual_abs": 0.4577879309654236,
"ronpo/target": -0.011954975314438343,
"ronpo/target_abs": 0.25632962584495544,
"ronpo/weight": 1.0,
"ronpo/weight_max": 1.0,
"step": 430
},
{
"epoch": 1.0,
"eval_logits/chosen": -0.4921875,
"eval_logits/rejected": -0.5,
"eval_logps/chosen": -13.5,
"eval_logps/rejected": -13.5,
"eval_loss": 0.35658061504364014,
"eval_rewards/accuracies": 0.5947136282920837,
"eval_rewards/chosen": -130.1977996826172,
"eval_rewards/margins": 0.8975045680999756,
"eval_rewards/rejected": -131.0952911376953,
"eval_ronpo/logit": 0.08975037932395935,
"eval_ronpo/residual": 0.07896483689546585,
"eval_ronpo/residual_abs": 0.3304201364517212,
"eval_ronpo/target": 0.010785548947751522,
"eval_ronpo/target_abs": 0.26927900314331055,
"eval_ronpo/weight": 1.0,
"eval_ronpo/weight_max": 1.0,
"eval_runtime": 181.9721,
"eval_samples_per_second": 9.958,
"eval_steps_per_second": 1.247,
"step": 437
},
{
"epoch": 1.0,
"step": 437,
"total_flos": 0.0,
"train_loss": 0.563431295704787,
"train_runtime": 9963.7635,
"train_samples_per_second": 5.614,
"train_steps_per_second": 0.044
}
],
"logging_steps": 10,
"max_steps": 437,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}