Files
1.7b-Comma0.1-300BT-longsft…/trainer_state.json

3239 lines
108 KiB
JSON
Raw Permalink Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 2130,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.004694835680751174,
"grad_norm": 349.74116855206194,
"learning_rate": 2.1126760563380282e-08,
"logits/chosen": -4.25,
"logits/rejected": -4.112500190734863,
"logps/chosen": -535.5999755859375,
"logps/rejected": -629.2000122070312,
"loss": 2.2736,
"rewards/accuracies": 0.17812499403953552,
"rewards/chosen": 0.1143798828125,
"rewards/margins": -0.07117919623851776,
"rewards/rejected": 0.18559570610523224,
"step": 10
},
{
"epoch": 0.009389671361502348,
"grad_norm": 376.55227149483585,
"learning_rate": 4.460093896713615e-08,
"logits/chosen": -4.135937690734863,
"logits/rejected": -4.090624809265137,
"logps/chosen": -563.5999755859375,
"logps/rejected": -632.0,
"loss": 3.1034,
"rewards/accuracies": 0.22734375298023224,
"rewards/chosen": -0.597216784954071,
"rewards/margins": -0.2764648497104645,
"rewards/rejected": -0.3194335997104645,
"step": 20
},
{
"epoch": 0.014084507042253521,
"grad_norm": 300.8383614545982,
"learning_rate": 6.807511737089202e-08,
"logits/chosen": -4.126562595367432,
"logits/rejected": -3.989062547683716,
"logps/chosen": -597.2000122070312,
"logps/rejected": -695.2000122070312,
"loss": 2.7347,
"rewards/accuracies": 0.23828125,
"rewards/chosen": -0.2744140625,
"rewards/margins": -0.08232422173023224,
"rewards/rejected": -0.19179686903953552,
"step": 30
},
{
"epoch": 0.018779342723004695,
"grad_norm": 350.24179262269337,
"learning_rate": 9.154929577464789e-08,
"logits/chosen": -4.199999809265137,
"logits/rejected": -4.0546875,
"logps/chosen": -587.4000244140625,
"logps/rejected": -709.5999755859375,
"loss": 3.0624,
"rewards/accuracies": 0.21796874701976776,
"rewards/chosen": -0.02348632737994194,
"rewards/margins": -0.41816407442092896,
"rewards/rejected": 0.3939453065395355,
"step": 40
},
{
"epoch": 0.023474178403755867,
"grad_norm": 342.8146294422575,
"learning_rate": 1.1502347417840374e-07,
"logits/chosen": -4.123437404632568,
"logits/rejected": -4.074999809265137,
"logps/chosen": -564.5999755859375,
"logps/rejected": -635.0,
"loss": 2.6875,
"rewards/accuracies": 0.24609375,
"rewards/chosen": 0.10722656548023224,
"rewards/margins": 0.19741210341453552,
"rewards/rejected": -0.09114990383386612,
"step": 50
},
{
"epoch": 0.028169014084507043,
"grad_norm": 339.2044897129424,
"learning_rate": 1.384976525821596e-07,
"logits/chosen": -4.199999809265137,
"logits/rejected": -4.053124904632568,
"logps/chosen": -579.2000122070312,
"logps/rejected": -690.4000244140625,
"loss": 3.0802,
"rewards/accuracies": 0.24140624701976776,
"rewards/chosen": -0.22633056342601776,
"rewards/margins": -0.522045910358429,
"rewards/rejected": 0.29487305879592896,
"step": 60
},
{
"epoch": 0.03286384976525822,
"grad_norm": 344.8739437734243,
"learning_rate": 1.619718309859155e-07,
"logits/chosen": -4.1171875,
"logits/rejected": -4.040625095367432,
"logps/chosen": -554.4000244140625,
"logps/rejected": -624.4000244140625,
"loss": 2.3888,
"rewards/accuracies": 0.24296875298023224,
"rewards/chosen": 0.2730468809604645,
"rewards/margins": 0.3682495057582855,
"rewards/rejected": -0.09394530951976776,
"step": 70
},
{
"epoch": 0.03755868544600939,
"grad_norm": 293.00995731278624,
"learning_rate": 1.8544600938967138e-07,
"logits/chosen": -4.196875095367432,
"logits/rejected": -4.126562595367432,
"logps/chosen": -566.2000122070312,
"logps/rejected": -664.0,
"loss": 2.6898,
"rewards/accuracies": 0.23749999701976776,
"rewards/chosen": 0.02299804612994194,
"rewards/margins": -0.01806640625,
"rewards/rejected": 0.04155273362994194,
"step": 80
},
{
"epoch": 0.04225352112676056,
"grad_norm": 359.38530776576044,
"learning_rate": 2.089201877934272e-07,
"logits/chosen": -4.215624809265137,
"logits/rejected": -4.115624904632568,
"logps/chosen": -541.0,
"logps/rejected": -614.7999877929688,
"loss": 2.678,
"rewards/accuracies": 0.2593750059604645,
"rewards/chosen": -0.11171875149011612,
"rewards/margins": 0.16367188096046448,
"rewards/rejected": -0.2755371034145355,
"step": 90
},
{
"epoch": 0.046948356807511735,
"grad_norm": 347.23080943128696,
"learning_rate": 2.323943661971831e-07,
"logits/chosen": -4.146874904632568,
"logits/rejected": -4.09375,
"logps/chosen": -586.0,
"logps/rejected": -617.5999755859375,
"loss": 2.7036,
"rewards/accuracies": 0.24531249701976776,
"rewards/chosen": -0.08134765923023224,
"rewards/margins": -0.08183594048023224,
"rewards/rejected": -0.0002929687616415322,
"step": 100
},
{
"epoch": 0.051643192488262914,
"grad_norm": 278.29672699724216,
"learning_rate": 2.5586854460093895e-07,
"logits/chosen": -4.199999809265137,
"logits/rejected": -4.050000190734863,
"logps/chosen": -563.2000122070312,
"logps/rejected": -668.4000244140625,
"loss": 2.9664,
"rewards/accuracies": 0.25078123807907104,
"rewards/chosen": 0.19809570908546448,
"rewards/margins": 0.358642578125,
"rewards/rejected": -0.1611328125,
"step": 110
},
{
"epoch": 0.056338028169014086,
"grad_norm": 375.61150910299864,
"learning_rate": 2.7934272300469483e-07,
"logits/chosen": -4.198437690734863,
"logits/rejected": -4.079687595367432,
"logps/chosen": -574.4000244140625,
"logps/rejected": -653.5999755859375,
"loss": 2.7307,
"rewards/accuracies": 0.25703126192092896,
"rewards/chosen": -0.01904296875,
"rewards/margins": 0.09003905951976776,
"rewards/rejected": -0.108123779296875,
"step": 120
},
{
"epoch": 0.06103286384976526,
"grad_norm": 360.0074496903726,
"learning_rate": 3.0281690140845066e-07,
"logits/chosen": -4.167187690734863,
"logits/rejected": -4.074999809265137,
"logps/chosen": -582.2000122070312,
"logps/rejected": -674.7999877929688,
"loss": 2.4376,
"rewards/accuracies": 0.2640624940395355,
"rewards/chosen": 0.48076170682907104,
"rewards/margins": 0.7203613519668579,
"rewards/rejected": -0.24033203721046448,
"step": 130
},
{
"epoch": 0.06572769953051644,
"grad_norm": 419.71980023046956,
"learning_rate": 3.2629107981220654e-07,
"logits/chosen": -4.145312309265137,
"logits/rejected": -4.081250190734863,
"logps/chosen": -570.4000244140625,
"logps/rejected": -685.5999755859375,
"loss": 2.4471,
"rewards/accuracies": 0.26093751192092896,
"rewards/chosen": 0.2666015625,
"rewards/margins": 0.9779297113418579,
"rewards/rejected": -0.7116943597793579,
"step": 140
},
{
"epoch": 0.07042253521126761,
"grad_norm": 423.5847107716145,
"learning_rate": 3.497652582159624e-07,
"logits/chosen": -4.206250190734863,
"logits/rejected": -4.15625,
"logps/chosen": -569.5999755859375,
"logps/rejected": -670.7999877929688,
"loss": 2.4638,
"rewards/accuracies": 0.2554687559604645,
"rewards/chosen": 0.37348634004592896,
"rewards/margins": 0.873828113079071,
"rewards/rejected": -0.502246081829071,
"step": 150
},
{
"epoch": 0.07511737089201878,
"grad_norm": 362.89859282348164,
"learning_rate": 3.732394366197183e-07,
"logits/chosen": -4.171875,
"logits/rejected": -4.057812690734863,
"logps/chosen": -589.2000122070312,
"logps/rejected": -674.7999877929688,
"loss": 2.6716,
"rewards/accuracies": 0.2601562440395355,
"rewards/chosen": 0.02895507775247097,
"rewards/margins": 0.669628918170929,
"rewards/rejected": -0.6392577886581421,
"step": 160
},
{
"epoch": 0.07981220657276995,
"grad_norm": 537.2242571500942,
"learning_rate": 3.967136150234742e-07,
"logits/chosen": -4.203125,
"logits/rejected": -4.0546875,
"logps/chosen": -540.0,
"logps/rejected": -656.0,
"loss": 2.7086,
"rewards/accuracies": 0.25390625,
"rewards/chosen": 0.41337889432907104,
"rewards/margins": 0.10888671875,
"rewards/rejected": 0.30546873807907104,
"step": 170
},
{
"epoch": 0.08450704225352113,
"grad_norm": 331.16907032576614,
"learning_rate": 4.2018779342723e-07,
"logits/chosen": -4.160937309265137,
"logits/rejected": -4.0390625,
"logps/chosen": -526.5999755859375,
"logps/rejected": -644.4000244140625,
"loss": 2.4346,
"rewards/accuracies": 0.2789062559604645,
"rewards/chosen": 0.42363280057907104,
"rewards/margins": 0.559277355670929,
"rewards/rejected": -0.13422851264476776,
"step": 180
},
{
"epoch": 0.0892018779342723,
"grad_norm": 332.45267620461516,
"learning_rate": 4.436619718309859e-07,
"logits/chosen": -4.142187595367432,
"logits/rejected": -4.095312595367432,
"logps/chosen": -566.2000122070312,
"logps/rejected": -630.4000244140625,
"loss": 2.3268,
"rewards/accuracies": 0.2906250059604645,
"rewards/chosen": 0.83203125,
"rewards/margins": 1.407812476158142,
"rewards/rejected": -0.576489269733429,
"step": 190
},
{
"epoch": 0.09389671361502347,
"grad_norm": 257.60750428836997,
"learning_rate": 4.671361502347418e-07,
"logits/chosen": -4.153124809265137,
"logits/rejected": -4.060937404632568,
"logps/chosen": -551.0,
"logps/rejected": -641.7999877929688,
"loss": 2.5818,
"rewards/accuracies": 0.2984375059604645,
"rewards/chosen": 0.871289074420929,
"rewards/margins": 1.178125023841858,
"rewards/rejected": -0.30723875761032104,
"step": 200
},
{
"epoch": 0.09859154929577464,
"grad_norm": 281.29526176415175,
"learning_rate": 4.906103286384976e-07,
"logits/chosen": -4.1875,
"logits/rejected": -4.0546875,
"logps/chosen": -560.7999877929688,
"logps/rejected": -674.7999877929688,
"loss": 2.62,
"rewards/accuracies": 0.28593748807907104,
"rewards/chosen": 0.8622070550918579,
"rewards/margins": 0.7486327886581421,
"rewards/rejected": 0.11201171576976776,
"step": 210
},
{
"epoch": 0.10328638497652583,
"grad_norm": 308.153426987116,
"learning_rate": 4.984350547730829e-07,
"logits/chosen": -4.253125190734863,
"logits/rejected": -4.131249904632568,
"logps/chosen": -574.4000244140625,
"logps/rejected": -650.4000244140625,
"loss": 2.6838,
"rewards/accuracies": 0.2945312559604645,
"rewards/chosen": 0.77734375,
"rewards/margins": 0.964306652545929,
"rewards/rejected": -0.18699951469898224,
"step": 220
},
{
"epoch": 0.107981220657277,
"grad_norm": 548.8366508731452,
"learning_rate": 4.958268127282212e-07,
"logits/chosen": -4.190625190734863,
"logits/rejected": -4.098437309265137,
"logps/chosen": -563.0,
"logps/rejected": -678.7999877929688,
"loss": 2.3709,
"rewards/accuracies": 0.31953126192092896,
"rewards/chosen": 1.235449194908142,
"rewards/margins": 1.4113280773162842,
"rewards/rejected": -0.17470702528953552,
"step": 230
},
{
"epoch": 0.11267605633802817,
"grad_norm": 323.1601733945601,
"learning_rate": 4.932185706833594e-07,
"logits/chosen": -4.165625095367432,
"logits/rejected": -4.106249809265137,
"logps/chosen": -518.4000244140625,
"logps/rejected": -564.5999755859375,
"loss": 2.1705,
"rewards/accuracies": 0.3296875059604645,
"rewards/chosen": 1.5910155773162842,
"rewards/margins": 2.05267333984375,
"rewards/rejected": -0.45966798067092896,
"step": 240
},
{
"epoch": 0.11737089201877934,
"grad_norm": 324.84319761474575,
"learning_rate": 4.906103286384976e-07,
"logits/chosen": -4.199999809265137,
"logits/rejected": -4.137499809265137,
"logps/chosen": -562.7999877929688,
"logps/rejected": -685.0,
"loss": 2.6149,
"rewards/accuracies": 0.3296875059604645,
"rewards/chosen": 0.911999523639679,
"rewards/margins": 1.7622559070587158,
"rewards/rejected": -0.8514648675918579,
"step": 250
},
{
"epoch": 0.12206572769953052,
"grad_norm": 363.5336462630036,
"learning_rate": 4.880020865936358e-07,
"logits/chosen": -4.146874904632568,
"logits/rejected": -4.084374904632568,
"logps/chosen": -530.5999755859375,
"logps/rejected": -631.7999877929688,
"loss": 2.274,
"rewards/accuracies": 0.3671875,
"rewards/chosen": 2.0082030296325684,
"rewards/margins": 3.0038084983825684,
"rewards/rejected": -0.9931640625,
"step": 260
},
{
"epoch": 0.1267605633802817,
"grad_norm": 518.6884921778877,
"learning_rate": 4.853938445487741e-07,
"logits/chosen": -4.087500095367432,
"logits/rejected": -4.048437595367432,
"logps/chosen": -562.7999877929688,
"logps/rejected": -662.7999877929688,
"loss": 2.6675,
"rewards/accuracies": 0.35078126192092896,
"rewards/chosen": 1.9542968273162842,
"rewards/margins": 2.491406202316284,
"rewards/rejected": -0.5386718511581421,
"step": 270
},
{
"epoch": 0.13145539906103287,
"grad_norm": 293.98547761001106,
"learning_rate": 4.827856025039123e-07,
"logits/chosen": -4.196875095367432,
"logits/rejected": -4.120312690734863,
"logps/chosen": -559.5999755859375,
"logps/rejected": -668.0,
"loss": 2.4366,
"rewards/accuracies": 0.37890625,
"rewards/chosen": 1.7419922351837158,
"rewards/margins": 2.5335936546325684,
"rewards/rejected": -0.7909911870956421,
"step": 280
},
{
"epoch": 0.13615023474178403,
"grad_norm": 297.7182843714146,
"learning_rate": 4.801773604590506e-07,
"logits/chosen": -4.159375190734863,
"logits/rejected": -4.084374904632568,
"logps/chosen": -601.7999877929688,
"logps/rejected": -663.5999755859375,
"loss": 2.6713,
"rewards/accuracies": 0.3890624940395355,
"rewards/chosen": 1.753515601158142,
"rewards/margins": 3.429882764816284,
"rewards/rejected": -1.6768066883087158,
"step": 290
},
{
"epoch": 0.14084507042253522,
"grad_norm": 282.45414453616195,
"learning_rate": 4.775691184141888e-07,
"logits/chosen": -4.157812595367432,
"logits/rejected": -4.096875190734863,
"logps/chosen": -579.5999755859375,
"logps/rejected": -658.7999877929688,
"loss": 2.2817,
"rewards/accuracies": 0.3804687559604645,
"rewards/chosen": 2.3656249046325684,
"rewards/margins": 3.7265625,
"rewards/rejected": -1.356054663658142,
"step": 300
},
{
"epoch": 0.14553990610328638,
"grad_norm": 332.6110171070324,
"learning_rate": 4.749608763693271e-07,
"logits/chosen": -4.190625190734863,
"logits/rejected": -4.103125095367432,
"logps/chosen": -554.0,
"logps/rejected": -646.7999877929688,
"loss": 2.4298,
"rewards/accuracies": 0.3804687559604645,
"rewards/chosen": 1.9066650867462158,
"rewards/margins": 3.2503905296325684,
"rewards/rejected": -1.341577172279358,
"step": 310
},
{
"epoch": 0.15023474178403756,
"grad_norm": 302.2874396052593,
"learning_rate": 4.7235263432446533e-07,
"logits/chosen": -4.178124904632568,
"logits/rejected": -4.078125,
"logps/chosen": -555.5999755859375,
"logps/rejected": -637.2000122070312,
"loss": 2.5541,
"rewards/accuracies": 0.3851562440395355,
"rewards/chosen": 1.837890625,
"rewards/margins": 3.7671875953674316,
"rewards/rejected": -1.9250977039337158,
"step": 320
},
{
"epoch": 0.15492957746478872,
"grad_norm": 404.9891924611719,
"learning_rate": 4.6974439227960353e-07,
"logits/chosen": -4.196875095367432,
"logits/rejected": -4.048437595367432,
"logps/chosen": -574.4000244140625,
"logps/rejected": -669.5999755859375,
"loss": 2.6687,
"rewards/accuracies": 0.390625,
"rewards/chosen": 2.23828125,
"rewards/margins": 3.703125,
"rewards/rejected": -1.466406226158142,
"step": 330
},
{
"epoch": 0.1596244131455399,
"grad_norm": 288.37085576554466,
"learning_rate": 4.671361502347418e-07,
"logits/chosen": -4.229687690734863,
"logits/rejected": -4.139062404632568,
"logps/chosen": -545.7999877929688,
"logps/rejected": -595.4000244140625,
"loss": 2.1681,
"rewards/accuracies": 0.41328126192092896,
"rewards/chosen": 2.313281297683716,
"rewards/margins": 3.8968749046325684,
"rewards/rejected": -1.5778319835662842,
"step": 340
},
{
"epoch": 0.1643192488262911,
"grad_norm": 318.64337747915073,
"learning_rate": 4.6452790818988004e-07,
"logits/chosen": -4.21875,
"logits/rejected": -4.162499904632568,
"logps/chosen": -581.5999755859375,
"logps/rejected": -670.0,
"loss": 2.3304,
"rewards/accuracies": 0.40156251192092896,
"rewards/chosen": 2.6039061546325684,
"rewards/margins": 5.3359375,
"rewards/rejected": -2.7320313453674316,
"step": 350
},
{
"epoch": 0.16901408450704225,
"grad_norm": 267.92746079560277,
"learning_rate": 4.6191966614501824e-07,
"logits/chosen": -4.1796875,
"logits/rejected": -4.082812309265137,
"logps/chosen": -550.2000122070312,
"logps/rejected": -637.2000122070312,
"loss": 2.6561,
"rewards/accuracies": 0.3921875059604645,
"rewards/chosen": 2.091796875,
"rewards/margins": 4.114062309265137,
"rewards/rejected": -2.0250244140625,
"step": 360
},
{
"epoch": 0.17370892018779344,
"grad_norm": 296.5721114007629,
"learning_rate": 4.593114241001565e-07,
"logits/chosen": -4.1328125,
"logits/rejected": -4.067187309265137,
"logps/chosen": -592.7999877929688,
"logps/rejected": -667.2000122070312,
"loss": 3.0078,
"rewards/accuracies": 0.44453126192092896,
"rewards/chosen": 2.4898438453674316,
"rewards/margins": 4.842968940734863,
"rewards/rejected": -2.357421875,
"step": 370
},
{
"epoch": 0.1784037558685446,
"grad_norm": 284.9647809945335,
"learning_rate": 4.5670318205529474e-07,
"logits/chosen": -4.15625,
"logits/rejected": -4.042187690734863,
"logps/chosen": -561.0,
"logps/rejected": -660.7999877929688,
"loss": 2.4469,
"rewards/accuracies": 0.40312498807907104,
"rewards/chosen": 2.018749952316284,
"rewards/margins": 3.625,
"rewards/rejected": -1.604272484779358,
"step": 380
},
{
"epoch": 0.18309859154929578,
"grad_norm": 244.9583744550648,
"learning_rate": 4.54094940010433e-07,
"logits/chosen": -4.165625095367432,
"logits/rejected": -4.065625190734863,
"logps/chosen": -570.7999877929688,
"logps/rejected": -675.7999877929688,
"loss": 2.1703,
"rewards/accuracies": 0.4164062440395355,
"rewards/chosen": 2.6109375953674316,
"rewards/margins": 5.390625,
"rewards/rejected": -2.77734375,
"step": 390
},
{
"epoch": 0.18779342723004694,
"grad_norm": 253.4802914868594,
"learning_rate": 4.514866979655712e-07,
"logits/chosen": -4.190625190734863,
"logits/rejected": -4.053124904632568,
"logps/chosen": -561.5999755859375,
"logps/rejected": -642.4000244140625,
"loss": 2.6224,
"rewards/accuracies": 0.43437498807907104,
"rewards/chosen": 2.860156297683716,
"rewards/margins": 5.653124809265137,
"rewards/rejected": -2.792187452316284,
"step": 400
},
{
"epoch": 0.19248826291079812,
"grad_norm": 263.3797100162804,
"learning_rate": 4.4887845592070945e-07,
"logits/chosen": -4.126562595367432,
"logits/rejected": -4.021874904632568,
"logps/chosen": -550.2000122070312,
"logps/rejected": -686.7999877929688,
"loss": 2.5782,
"rewards/accuracies": 0.41874998807907104,
"rewards/chosen": 1.927734375,
"rewards/margins": 5.271874904632568,
"rewards/rejected": -3.3382811546325684,
"step": 410
},
{
"epoch": 0.19718309859154928,
"grad_norm": 276.9425213989649,
"learning_rate": 4.462702138758477e-07,
"logits/chosen": -4.131249904632568,
"logits/rejected": -4.050000190734863,
"logps/chosen": -587.7999877929688,
"logps/rejected": -651.5999755859375,
"loss": 2.6343,
"rewards/accuracies": 0.4296875,
"rewards/chosen": 1.989843726158142,
"rewards/margins": 5.115624904632568,
"rewards/rejected": -3.1265625953674316,
"step": 420
},
{
"epoch": 0.20187793427230047,
"grad_norm": 318.8701653678301,
"learning_rate": 4.436619718309859e-07,
"logits/chosen": -4.115624904632568,
"logits/rejected": -3.9749999046325684,
"logps/chosen": -571.5999755859375,
"logps/rejected": -694.4000244140625,
"loss": 2.8542,
"rewards/accuracies": 0.3929687440395355,
"rewards/chosen": 1.5437500476837158,
"rewards/margins": 5.095507621765137,
"rewards/rejected": -3.548046827316284,
"step": 430
},
{
"epoch": 0.20657276995305165,
"grad_norm": 266.8593158918352,
"learning_rate": 4.4105372978612415e-07,
"logits/chosen": -4.221875190734863,
"logits/rejected": -4.103125095367432,
"logps/chosen": -587.2000122070312,
"logps/rejected": -678.4000244140625,
"loss": 2.751,
"rewards/accuracies": 0.4437499940395355,
"rewards/chosen": 2.030078172683716,
"rewards/margins": 5.284375190734863,
"rewards/rejected": -3.2515625953674316,
"step": 440
},
{
"epoch": 0.2112676056338028,
"grad_norm": 292.8532836816308,
"learning_rate": 4.384454877412624e-07,
"logits/chosen": -4.190625190734863,
"logits/rejected": -4.060937404632568,
"logps/chosen": -572.2000122070312,
"logps/rejected": -743.2000122070312,
"loss": 3.1477,
"rewards/accuracies": 0.42656248807907104,
"rewards/chosen": 2.553906202316284,
"rewards/margins": 5.631249904632568,
"rewards/rejected": -3.0757813453674316,
"step": 450
},
{
"epoch": 0.215962441314554,
"grad_norm": 256.3005652537314,
"learning_rate": 4.358372456964006e-07,
"logits/chosen": -4.140625,
"logits/rejected": -4.095312595367432,
"logps/chosen": -564.0,
"logps/rejected": -662.7999877929688,
"loss": 2.4115,
"rewards/accuracies": 0.453125,
"rewards/chosen": 2.8539061546325684,
"rewards/margins": 5.910937309265137,
"rewards/rejected": -3.0570311546325684,
"step": 460
},
{
"epoch": 0.22065727699530516,
"grad_norm": 288.136171582801,
"learning_rate": 4.3322900365153886e-07,
"logits/chosen": -4.237500190734863,
"logits/rejected": -4.092187404632568,
"logps/chosen": -602.7999877929688,
"logps/rejected": -665.5999755859375,
"loss": 3.2443,
"rewards/accuracies": 0.43828123807907104,
"rewards/chosen": 1.791528344154358,
"rewards/margins": 4.225390434265137,
"rewards/rejected": -2.439453125,
"step": 470
},
{
"epoch": 0.22535211267605634,
"grad_norm": 250.77020639486426,
"learning_rate": 4.306207616066771e-07,
"logits/chosen": -4.215624809265137,
"logits/rejected": -4.1015625,
"logps/chosen": -551.5999755859375,
"logps/rejected": -638.0,
"loss": 2.6011,
"rewards/accuracies": 0.41874998807907104,
"rewards/chosen": 2.882031202316284,
"rewards/margins": 4.392968654632568,
"rewards/rejected": -1.5114257335662842,
"step": 480
},
{
"epoch": 0.2300469483568075,
"grad_norm": 244.34973254893228,
"learning_rate": 4.280125195618153e-07,
"logits/chosen": -4.157812595367432,
"logits/rejected": -4.017187595367432,
"logps/chosen": -562.7999877929688,
"logps/rejected": -672.2000122070312,
"loss": 2.6576,
"rewards/accuracies": 0.4117187559604645,
"rewards/chosen": 2.296875,
"rewards/margins": 6.037499904632568,
"rewards/rejected": -3.7393431663513184,
"step": 490
},
{
"epoch": 0.2347417840375587,
"grad_norm": 245.7589655838516,
"learning_rate": 4.2540427751695357e-07,
"logits/chosen": -4.165625095367432,
"logits/rejected": -4.073437690734863,
"logps/chosen": -569.2000122070312,
"logps/rejected": -641.7999877929688,
"loss": 3.3399,
"rewards/accuracies": 0.4164062440395355,
"rewards/chosen": 2.551562547683716,
"rewards/margins": 4.9765625,
"rewards/rejected": -2.4300780296325684,
"step": 500
},
{
"epoch": 0.23943661971830985,
"grad_norm": 273.17619762972186,
"learning_rate": 4.227960354720918e-07,
"logits/chosen": -4.232812404632568,
"logits/rejected": -4.134375095367432,
"logps/chosen": -556.4000244140625,
"logps/rejected": -680.4000244140625,
"loss": 2.3361,
"rewards/accuracies": 0.4320312440395355,
"rewards/chosen": 3.112499952316284,
"rewards/margins": 5.8671875,
"rewards/rejected": -2.7515625953674316,
"step": 510
},
{
"epoch": 0.24413145539906103,
"grad_norm": 263.0614856896538,
"learning_rate": 4.2018779342723e-07,
"logits/chosen": -4.182812690734863,
"logits/rejected": -4.110937595367432,
"logps/chosen": -573.2000122070312,
"logps/rejected": -632.4000244140625,
"loss": 2.7766,
"rewards/accuracies": 0.4351562559604645,
"rewards/chosen": 2.3656249046325684,
"rewards/margins": 5.109375,
"rewards/rejected": -2.745898485183716,
"step": 520
},
{
"epoch": 0.24882629107981222,
"grad_norm": 302.5738298315578,
"learning_rate": 4.1757955138236827e-07,
"logits/chosen": -4.234375,
"logits/rejected": -4.090624809265137,
"logps/chosen": -555.5999755859375,
"logps/rejected": -667.2000122070312,
"loss": 2.8871,
"rewards/accuracies": 0.47187501192092896,
"rewards/chosen": 2.374218702316284,
"rewards/margins": 5.859375,
"rewards/rejected": -3.4857420921325684,
"step": 530
},
{
"epoch": 0.2535211267605634,
"grad_norm": 352.80345813139655,
"learning_rate": 4.149713093375065e-07,
"logits/chosen": -4.203125,
"logits/rejected": -4.1015625,
"logps/chosen": -556.5999755859375,
"logps/rejected": -612.2000122070312,
"loss": 2.5234,
"rewards/accuracies": 0.46015626192092896,
"rewards/chosen": 2.77734375,
"rewards/margins": 5.982812404632568,
"rewards/rejected": -3.2035155296325684,
"step": 540
},
{
"epoch": 0.25821596244131456,
"grad_norm": 260.6895436253073,
"learning_rate": 4.123630672926447e-07,
"logits/chosen": -4.181250095367432,
"logits/rejected": -4.110937595367432,
"logps/chosen": -545.4000244140625,
"logps/rejected": -660.5999755859375,
"loss": 2.3198,
"rewards/accuracies": 0.42656248807907104,
"rewards/chosen": 2.5062499046325684,
"rewards/margins": 6.728125095367432,
"rewards/rejected": -4.215624809265137,
"step": 550
},
{
"epoch": 0.26291079812206575,
"grad_norm": 274.729220638694,
"learning_rate": 4.09754825247783e-07,
"logits/chosen": -4.181250095367432,
"logits/rejected": -4.096875190734863,
"logps/chosen": -565.5999755859375,
"logps/rejected": -642.7999877929688,
"loss": 2.6591,
"rewards/accuracies": 0.43828123807907104,
"rewards/chosen": 2.645312547683716,
"rewards/margins": 6.806250095367432,
"rewards/rejected": -4.172656059265137,
"step": 560
},
{
"epoch": 0.2676056338028169,
"grad_norm": 247.46078526722945,
"learning_rate": 4.0714658320292123e-07,
"logits/chosen": -4.214062690734863,
"logits/rejected": -4.089062690734863,
"logps/chosen": -564.4000244140625,
"logps/rejected": -660.0,
"loss": 2.694,
"rewards/accuracies": 0.44140625,
"rewards/chosen": 2.1488280296325684,
"rewards/margins": 6.8359375,
"rewards/rejected": -4.680468559265137,
"step": 570
},
{
"epoch": 0.27230046948356806,
"grad_norm": 306.74341657476623,
"learning_rate": 4.045383411580595e-07,
"logits/chosen": -4.224999904632568,
"logits/rejected": -4.137499809265137,
"logps/chosen": -544.5999755859375,
"logps/rejected": -656.4000244140625,
"loss": 2.9487,
"rewards/accuracies": 0.4234375059604645,
"rewards/chosen": 1.7294921875,
"rewards/margins": 5.262499809265137,
"rewards/rejected": -3.5355467796325684,
"step": 580
},
{
"epoch": 0.27699530516431925,
"grad_norm": 318.14800096014113,
"learning_rate": 4.019300991131977e-07,
"logits/chosen": -4.159375190734863,
"logits/rejected": -4.051562309265137,
"logps/chosen": -547.4000244140625,
"logps/rejected": -647.2000122070312,
"loss": 2.5842,
"rewards/accuracies": 0.4554687440395355,
"rewards/chosen": 2.6656250953674316,
"rewards/margins": 6.821875095367432,
"rewards/rejected": -4.153515815734863,
"step": 590
},
{
"epoch": 0.28169014084507044,
"grad_norm": 229.49976631713287,
"learning_rate": 3.9932185706833594e-07,
"logits/chosen": -4.21875,
"logits/rejected": -4.112500190734863,
"logps/chosen": -572.7999877929688,
"logps/rejected": -647.5999755859375,
"loss": 2.9184,
"rewards/accuracies": 0.4546875059604645,
"rewards/chosen": 2.377734422683716,
"rewards/margins": 7.287499904632568,
"rewards/rejected": -4.907812595367432,
"step": 600
},
{
"epoch": 0.2863849765258216,
"grad_norm": 249.01193980392725,
"learning_rate": 3.967136150234742e-07,
"logits/chosen": -4.168749809265137,
"logits/rejected": -4.095312595367432,
"logps/chosen": -574.7999877929688,
"logps/rejected": -663.0,
"loss": 2.5218,
"rewards/accuracies": 0.45390623807907104,
"rewards/chosen": 2.596874952316284,
"rewards/margins": 6.484375,
"rewards/rejected": -3.889843702316284,
"step": 610
},
{
"epoch": 0.29107981220657275,
"grad_norm": 225.71400979655567,
"learning_rate": 3.941053729786124e-07,
"logits/chosen": -4.175000190734863,
"logits/rejected": -4.082812309265137,
"logps/chosen": -578.0,
"logps/rejected": -657.5999755859375,
"loss": 2.5098,
"rewards/accuracies": 0.4593749940395355,
"rewards/chosen": 2.515625,
"rewards/margins": 7.762499809265137,
"rewards/rejected": -5.243750095367432,
"step": 620
},
{
"epoch": 0.29577464788732394,
"grad_norm": 279.9672078725096,
"learning_rate": 3.9149713093375064e-07,
"logits/chosen": -4.114062309265137,
"logits/rejected": -3.9984374046325684,
"logps/chosen": -568.7999877929688,
"logps/rejected": -678.0,
"loss": 2.6434,
"rewards/accuracies": 0.46562498807907104,
"rewards/chosen": 2.7125000953674316,
"rewards/margins": 7.846875190734863,
"rewards/rejected": -5.134765625,
"step": 630
},
{
"epoch": 0.3004694835680751,
"grad_norm": 266.7534618210619,
"learning_rate": 3.888888888888889e-07,
"logits/chosen": -4.1875,
"logits/rejected": -4.035937309265137,
"logps/chosen": -558.5999755859375,
"logps/rejected": -691.5999755859375,
"loss": 2.1453,
"rewards/accuracies": 0.47187501192092896,
"rewards/chosen": 3.3109374046325684,
"rewards/margins": 8.459375381469727,
"rewards/rejected": -5.1484375,
"step": 640
},
{
"epoch": 0.3051643192488263,
"grad_norm": 236.94805089034128,
"learning_rate": 3.862806468440271e-07,
"logits/chosen": -4.28125,
"logits/rejected": -4.196875095367432,
"logps/chosen": -516.4000244140625,
"logps/rejected": -614.0,
"loss": 2.1915,
"rewards/accuracies": 0.4828124940395355,
"rewards/chosen": 2.585156202316284,
"rewards/margins": 6.989062309265137,
"rewards/rejected": -4.405468940734863,
"step": 650
},
{
"epoch": 0.30985915492957744,
"grad_norm": 305.31826133508156,
"learning_rate": 3.8367240479916535e-07,
"logits/chosen": -4.2109375,
"logits/rejected": -4.159375190734863,
"logps/chosen": -550.5999755859375,
"logps/rejected": -619.7999877929688,
"loss": 2.6323,
"rewards/accuracies": 0.46171873807907104,
"rewards/chosen": 2.649218797683716,
"rewards/margins": 6.571875095367432,
"rewards/rejected": -3.919921875,
"step": 660
},
{
"epoch": 0.3145539906103286,
"grad_norm": 263.7170782636469,
"learning_rate": 3.810641627543036e-07,
"logits/chosen": -4.203125,
"logits/rejected": -4.110937595367432,
"logps/chosen": -567.2000122070312,
"logps/rejected": -653.0,
"loss": 2.9518,
"rewards/accuracies": 0.46171873807907104,
"rewards/chosen": 2.742968797683716,
"rewards/margins": 6.548437595367432,
"rewards/rejected": -3.8017578125,
"step": 670
},
{
"epoch": 0.3192488262910798,
"grad_norm": 288.4732382762268,
"learning_rate": 3.784559207094418e-07,
"logits/chosen": -4.175000190734863,
"logits/rejected": -4.0859375,
"logps/chosen": -585.2000122070312,
"logps/rejected": -644.0,
"loss": 2.6914,
"rewards/accuracies": 0.4468750059604645,
"rewards/chosen": 2.3148436546325684,
"rewards/margins": 6.192187309265137,
"rewards/rejected": -3.8734374046325684,
"step": 680
},
{
"epoch": 0.323943661971831,
"grad_norm": 217.38072291200496,
"learning_rate": 3.7584767866458005e-07,
"logits/chosen": -4.159375190734863,
"logits/rejected": -4.060937404632568,
"logps/chosen": -569.4000244140625,
"logps/rejected": -616.4000244140625,
"loss": 2.131,
"rewards/accuracies": 0.46953123807907104,
"rewards/chosen": 2.615234375,
"rewards/margins": 7.329687595367432,
"rewards/rejected": -4.721875190734863,
"step": 690
},
{
"epoch": 0.3286384976525822,
"grad_norm": 653.7281081824505,
"learning_rate": 3.732394366197183e-07,
"logits/chosen": -4.224999904632568,
"logits/rejected": -4.128125190734863,
"logps/chosen": -598.2000122070312,
"logps/rejected": -633.2000122070312,
"loss": 3.6844,
"rewards/accuracies": 0.44843751192092896,
"rewards/chosen": 1.9679687023162842,
"rewards/margins": 5.3046875,
"rewards/rejected": -3.3343749046325684,
"step": 700
},
{
"epoch": 0.3333333333333333,
"grad_norm": 297.13616489844844,
"learning_rate": 3.706311945748565e-07,
"logits/chosen": -4.181250095367432,
"logits/rejected": -4.0859375,
"logps/chosen": -614.0,
"logps/rejected": -640.0,
"loss": 2.9492,
"rewards/accuracies": 0.4632812440395355,
"rewards/chosen": 2.1050782203674316,
"rewards/margins": 6.079687595367432,
"rewards/rejected": -3.96875,
"step": 710
},
{
"epoch": 0.3380281690140845,
"grad_norm": 306.0595029923629,
"learning_rate": 3.6802295252999476e-07,
"logits/chosen": -4.159375190734863,
"logits/rejected": -4.045312404632568,
"logps/chosen": -581.4000244140625,
"logps/rejected": -682.5999755859375,
"loss": 2.7086,
"rewards/accuracies": 0.47968751192092896,
"rewards/chosen": 2.446093797683716,
"rewards/margins": 7.996874809265137,
"rewards/rejected": -5.534375190734863,
"step": 720
},
{
"epoch": 0.3427230046948357,
"grad_norm": 358.5106606361576,
"learning_rate": 3.65414710485133e-07,
"logits/chosen": -4.175000190734863,
"logits/rejected": -4.090624809265137,
"logps/chosen": -576.2000122070312,
"logps/rejected": -626.4000244140625,
"loss": 3.0882,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 1.953582763671875,
"rewards/margins": 6.353125095367432,
"rewards/rejected": -4.404687404632568,
"step": 730
},
{
"epoch": 0.3474178403755869,
"grad_norm": 236.0280317249739,
"learning_rate": 3.6280646844027127e-07,
"logits/chosen": -4.140625,
"logits/rejected": -4.065625190734863,
"logps/chosen": -554.7999877929688,
"logps/rejected": -696.7999877929688,
"loss": 2.7726,
"rewards/accuracies": 0.47265625,
"rewards/chosen": 2.4244141578674316,
"rewards/margins": 8.4375,
"rewards/rejected": -6.0234375,
"step": 740
},
{
"epoch": 0.352112676056338,
"grad_norm": 246.58963908566164,
"learning_rate": 3.6019822639540947e-07,
"logits/chosen": -4.181250095367432,
"logits/rejected": -4.084374904632568,
"logps/chosen": -589.4000244140625,
"logps/rejected": -622.7999877929688,
"loss": 2.3574,
"rewards/accuracies": 0.4507812559604645,
"rewards/chosen": 2.913281202316284,
"rewards/margins": 6.365624904632568,
"rewards/rejected": -3.453906297683716,
"step": 750
},
{
"epoch": 0.3568075117370892,
"grad_norm": 289.90626390753835,
"learning_rate": 3.575899843505477e-07,
"logits/chosen": -4.168749809265137,
"logits/rejected": -4.099999904632568,
"logps/chosen": -562.2000122070312,
"logps/rejected": -609.0,
"loss": 3.0627,
"rewards/accuracies": 0.484375,
"rewards/chosen": 2.616406202316284,
"rewards/margins": 6.787499904632568,
"rewards/rejected": -4.173437595367432,
"step": 760
},
{
"epoch": 0.3615023474178404,
"grad_norm": 266.4393683231025,
"learning_rate": 3.5498174230568597e-07,
"logits/chosen": -4.110937595367432,
"logits/rejected": -4.034375190734863,
"logps/chosen": -561.0,
"logps/rejected": -649.5999755859375,
"loss": 2.4062,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 2.5062499046325684,
"rewards/margins": 7.526562690734863,
"rewards/rejected": -5.020312309265137,
"step": 770
},
{
"epoch": 0.36619718309859156,
"grad_norm": 358.3088872337145,
"learning_rate": 3.5237350026082417e-07,
"logits/chosen": -4.140625,
"logits/rejected": -4.050000190734863,
"logps/chosen": -568.4000244140625,
"logps/rejected": -603.2000122070312,
"loss": 2.9134,
"rewards/accuracies": 0.4742187559604645,
"rewards/chosen": 2.537890672683716,
"rewards/margins": 6.315625190734863,
"rewards/rejected": -3.782031297683716,
"step": 780
},
{
"epoch": 0.37089201877934275,
"grad_norm": 269.79098156201337,
"learning_rate": 3.497652582159624e-07,
"logits/chosen": -4.146874904632568,
"logits/rejected": -4.051562309265137,
"logps/chosen": -572.7999877929688,
"logps/rejected": -672.7999877929688,
"loss": 3.0026,
"rewards/accuracies": 0.47578126192092896,
"rewards/chosen": 2.8570313453674316,
"rewards/margins": 7.462500095367432,
"rewards/rejected": -4.6015625,
"step": 790
},
{
"epoch": 0.3755868544600939,
"grad_norm": 291.7111715601876,
"learning_rate": 3.471570161711007e-07,
"logits/chosen": -4.181250095367432,
"logits/rejected": -4.0546875,
"logps/chosen": -600.0,
"logps/rejected": -681.7999877929688,
"loss": 3.0534,
"rewards/accuracies": 0.4859375059604645,
"rewards/chosen": 2.608203172683716,
"rewards/margins": 7.348437309265137,
"rewards/rejected": -4.737500190734863,
"step": 800
},
{
"epoch": 0.38028169014084506,
"grad_norm": 363.3048347931511,
"learning_rate": 3.445487741262389e-07,
"logits/chosen": -4.196875095367432,
"logits/rejected": -4.115624904632568,
"logps/chosen": -550.4000244140625,
"logps/rejected": -640.4000244140625,
"loss": 3.0931,
"rewards/accuracies": 0.4945312440395355,
"rewards/chosen": 2.6695313453674316,
"rewards/margins": 7.228125095367432,
"rewards/rejected": -4.556250095367432,
"step": 810
},
{
"epoch": 0.38497652582159625,
"grad_norm": 275.9406603434156,
"learning_rate": 3.4194053208137713e-07,
"logits/chosen": -4.167187690734863,
"logits/rejected": -4.089062690734863,
"logps/chosen": -561.2000122070312,
"logps/rejected": -618.0,
"loss": 2.7053,
"rewards/accuracies": 0.48515623807907104,
"rewards/chosen": 2.9124999046325684,
"rewards/margins": 6.731249809265137,
"rewards/rejected": -3.8148436546325684,
"step": 820
},
{
"epoch": 0.38967136150234744,
"grad_norm": 268.47634850337175,
"learning_rate": 3.393322900365154e-07,
"logits/chosen": -4.190625190734863,
"logits/rejected": -4.025000095367432,
"logps/chosen": -531.0,
"logps/rejected": -618.5999755859375,
"loss": 2.6724,
"rewards/accuracies": 0.4625000059604645,
"rewards/chosen": 1.915624976158142,
"rewards/margins": 6.973437309265137,
"rewards/rejected": -5.057812690734863,
"step": 830
},
{
"epoch": 0.39436619718309857,
"grad_norm": 245.17621324219382,
"learning_rate": 3.367240479916536e-07,
"logits/chosen": -4.184374809265137,
"logits/rejected": -4.059374809265137,
"logps/chosen": -596.4000244140625,
"logps/rejected": -670.4000244140625,
"loss": 3.5967,
"rewards/accuracies": 0.49531251192092896,
"rewards/chosen": 2.061877489089966,
"rewards/margins": 7.34375,
"rewards/rejected": -5.278124809265137,
"step": 840
},
{
"epoch": 0.39906103286384975,
"grad_norm": 237.29929143033954,
"learning_rate": 3.3411580594679184e-07,
"logits/chosen": -4.221875190734863,
"logits/rejected": -4.098437309265137,
"logps/chosen": -552.5999755859375,
"logps/rejected": -644.0,
"loss": 2.5816,
"rewards/accuracies": 0.46484375,
"rewards/chosen": 2.669726610183716,
"rewards/margins": 7.145312309265137,
"rewards/rejected": -4.478906154632568,
"step": 850
},
{
"epoch": 0.40375586854460094,
"grad_norm": 279.3549218574099,
"learning_rate": 3.315075639019301e-07,
"logits/chosen": -4.170312404632568,
"logits/rejected": -4.106249809265137,
"logps/chosen": -545.2000122070312,
"logps/rejected": -643.5999755859375,
"loss": 2.5559,
"rewards/accuracies": 0.48515623807907104,
"rewards/chosen": 2.764453172683716,
"rewards/margins": 8.717187881469727,
"rewards/rejected": -5.959765434265137,
"step": 860
},
{
"epoch": 0.4084507042253521,
"grad_norm": 308.47860266588174,
"learning_rate": 3.288993218570683e-07,
"logits/chosen": -4.1953125,
"logits/rejected": -4.067187309265137,
"logps/chosen": -552.4000244140625,
"logps/rejected": -623.2000122070312,
"loss": 2.7292,
"rewards/accuracies": 0.4789062440395355,
"rewards/chosen": 2.921875,
"rewards/margins": 6.7890625,
"rewards/rejected": -3.872265577316284,
"step": 870
},
{
"epoch": 0.4131455399061033,
"grad_norm": 206.97891373240537,
"learning_rate": 3.2629107981220654e-07,
"logits/chosen": -4.182812690734863,
"logits/rejected": -4.040625095367432,
"logps/chosen": -576.7999877929688,
"logps/rejected": -646.5999755859375,
"loss": 2.8882,
"rewards/accuracies": 0.47968751192092896,
"rewards/chosen": 2.184375047683716,
"rewards/margins": 7.6875,
"rewards/rejected": -5.503125190734863,
"step": 880
},
{
"epoch": 0.41784037558685444,
"grad_norm": 298.5862678350748,
"learning_rate": 3.236828377673448e-07,
"logits/chosen": -4.121874809265137,
"logits/rejected": -4.0859375,
"logps/chosen": -600.4000244140625,
"logps/rejected": -642.4000244140625,
"loss": 3.9504,
"rewards/accuracies": 0.46875,
"rewards/chosen": 1.659765601158142,
"rewards/margins": 5.358593940734863,
"rewards/rejected": -3.6957030296325684,
"step": 890
},
{
"epoch": 0.4225352112676056,
"grad_norm": 263.44877450986564,
"learning_rate": 3.2107459572248305e-07,
"logits/chosen": -4.126562595367432,
"logits/rejected": -4.053124904632568,
"logps/chosen": -577.7999877929688,
"logps/rejected": -647.4000244140625,
"loss": 3.2681,
"rewards/accuracies": 0.4984374940395355,
"rewards/chosen": 1.71875,
"rewards/margins": 7.209374904632568,
"rewards/rejected": -5.490624904632568,
"step": 900
},
{
"epoch": 0.4272300469483568,
"grad_norm": 321.2673994592104,
"learning_rate": 3.1846635367762125e-07,
"logits/chosen": -4.151562690734863,
"logits/rejected": -4.056250095367432,
"logps/chosen": -578.4000244140625,
"logps/rejected": -677.0,
"loss": 3.0926,
"rewards/accuracies": 0.47343748807907104,
"rewards/chosen": 2.348437547683716,
"rewards/margins": 8.5,
"rewards/rejected": -6.154687404632568,
"step": 910
},
{
"epoch": 0.431924882629108,
"grad_norm": 521.8306086900999,
"learning_rate": 3.158581116327595e-07,
"logits/chosen": -4.171875,
"logits/rejected": -4.0703125,
"logps/chosen": -576.4000244140625,
"logps/rejected": -704.0,
"loss": 2.9125,
"rewards/accuracies": 0.46796876192092896,
"rewards/chosen": 2.3511719703674316,
"rewards/margins": 8.321874618530273,
"rewards/rejected": -5.971875190734863,
"step": 920
},
{
"epoch": 0.43661971830985913,
"grad_norm": 233.362548438678,
"learning_rate": 3.1324986958789775e-07,
"logits/chosen": -4.196875095367432,
"logits/rejected": -4.1015625,
"logps/chosen": -537.7999877929688,
"logps/rejected": -620.4000244140625,
"loss": 2.7801,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 2.37890625,
"rewards/margins": 6.845312595367432,
"rewards/rejected": -4.46875,
"step": 930
},
{
"epoch": 0.4413145539906103,
"grad_norm": 329.5226337227366,
"learning_rate": 3.1064162754303595e-07,
"logits/chosen": -4.15625,
"logits/rejected": -4.017187595367432,
"logps/chosen": -578.4000244140625,
"logps/rejected": -681.2000122070312,
"loss": 2.9188,
"rewards/accuracies": 0.4554687440395355,
"rewards/chosen": 1.9997069835662842,
"rewards/margins": 7.139062404632568,
"rewards/rejected": -5.1474609375,
"step": 940
},
{
"epoch": 0.4460093896713615,
"grad_norm": 239.68311170701213,
"learning_rate": 3.080333854981742e-07,
"logits/chosen": -4.1484375,
"logits/rejected": -4.051562309265137,
"logps/chosen": -563.0,
"logps/rejected": -619.5999755859375,
"loss": 2.8894,
"rewards/accuracies": 0.4671874940395355,
"rewards/chosen": 2.0376954078674316,
"rewards/margins": 6.135937690734863,
"rewards/rejected": -4.109375,
"step": 950
},
{
"epoch": 0.4507042253521127,
"grad_norm": 301.66609073609294,
"learning_rate": 3.0542514345331246e-07,
"logits/chosen": -4.175000190734863,
"logits/rejected": -4.079687595367432,
"logps/chosen": -573.2000122070312,
"logps/rejected": -706.5999755859375,
"loss": 2.8653,
"rewards/accuracies": 0.48124998807907104,
"rewards/chosen": 2.757031202316284,
"rewards/margins": 9.146875381469727,
"rewards/rejected": -6.389843940734863,
"step": 960
},
{
"epoch": 0.45539906103286387,
"grad_norm": 323.5455994600225,
"learning_rate": 3.0281690140845066e-07,
"logits/chosen": -4.126562595367432,
"logits/rejected": -4.0703125,
"logps/chosen": -601.2000122070312,
"logps/rejected": -667.4000244140625,
"loss": 3.0966,
"rewards/accuracies": 0.4898437559604645,
"rewards/chosen": 2.321484327316284,
"rewards/margins": 7.056250095367432,
"rewards/rejected": -4.736523628234863,
"step": 970
},
{
"epoch": 0.460093896713615,
"grad_norm": 421.72099522991505,
"learning_rate": 3.002086593635889e-07,
"logits/chosen": -4.217187404632568,
"logits/rejected": -4.071875095367432,
"logps/chosen": -565.0,
"logps/rejected": -675.2000122070312,
"loss": 2.4046,
"rewards/accuracies": 0.4765625,
"rewards/chosen": 2.875,
"rewards/margins": 8.495312690734863,
"rewards/rejected": -5.607031345367432,
"step": 980
},
{
"epoch": 0.4647887323943662,
"grad_norm": 255.42606181348677,
"learning_rate": 2.9760041731872716e-07,
"logits/chosen": -4.199999809265137,
"logits/rejected": -4.095312595367432,
"logps/chosen": -528.2000122070312,
"logps/rejected": -634.5999755859375,
"loss": 2.2063,
"rewards/accuracies": 0.500781238079071,
"rewards/chosen": 3.0234375,
"rewards/margins": 8.315625190734863,
"rewards/rejected": -5.29296875,
"step": 990
},
{
"epoch": 0.4694835680751174,
"grad_norm": 247.2621494249662,
"learning_rate": 2.9499217527386536e-07,
"logits/chosen": -4.190625190734863,
"logits/rejected": -4.09375,
"logps/chosen": -553.4000244140625,
"logps/rejected": -650.7999877929688,
"loss": 2.5919,
"rewards/accuracies": 0.46171873807907104,
"rewards/chosen": 2.6890625953674316,
"rewards/margins": 7.465624809265137,
"rewards/rejected": -4.764062404632568,
"step": 1000
},
{
"epoch": 0.47417840375586856,
"grad_norm": 241.71432645437105,
"learning_rate": 2.923839332290036e-07,
"logits/chosen": -4.135937690734863,
"logits/rejected": -4.045312404632568,
"logps/chosen": -550.7999877929688,
"logps/rejected": -664.4000244140625,
"loss": 2.9087,
"rewards/accuracies": 0.48046875,
"rewards/chosen": 1.9425780773162842,
"rewards/margins": 7.287499904632568,
"rewards/rejected": -5.348437309265137,
"step": 1010
},
{
"epoch": 0.4788732394366197,
"grad_norm": 341.6647376563316,
"learning_rate": 2.8977569118414187e-07,
"logits/chosen": -4.256249904632568,
"logits/rejected": -4.1171875,
"logps/chosen": -539.2000122070312,
"logps/rejected": -631.2000122070312,
"loss": 2.4963,
"rewards/accuracies": 0.49921876192092896,
"rewards/chosen": 2.3375000953674316,
"rewards/margins": 8.607812881469727,
"rewards/rejected": -6.264062404632568,
"step": 1020
},
{
"epoch": 0.4835680751173709,
"grad_norm": 278.12529305873784,
"learning_rate": 2.8716744913928007e-07,
"logits/chosen": -4.231249809265137,
"logits/rejected": -4.129687309265137,
"logps/chosen": -562.4000244140625,
"logps/rejected": -627.5999755859375,
"loss": 2.8734,
"rewards/accuracies": 0.4867187440395355,
"rewards/chosen": 2.433789014816284,
"rewards/margins": 7.042187690734863,
"rewards/rejected": -4.610156059265137,
"step": 1030
},
{
"epoch": 0.48826291079812206,
"grad_norm": 222.4151347018538,
"learning_rate": 2.845592070944183e-07,
"logits/chosen": -4.215624809265137,
"logits/rejected": -4.107812404632568,
"logps/chosen": -559.7999877929688,
"logps/rejected": -679.2000122070312,
"loss": 2.6678,
"rewards/accuracies": 0.48046875,
"rewards/chosen": 2.8414063453674316,
"rewards/margins": 7.800000190734863,
"rewards/rejected": -4.963671684265137,
"step": 1040
},
{
"epoch": 0.49295774647887325,
"grad_norm": 1896.746417849367,
"learning_rate": 2.819509650495566e-07,
"logits/chosen": -4.1953125,
"logits/rejected": -4.046875,
"logps/chosen": -551.5999755859375,
"logps/rejected": -624.0,
"loss": 2.7115,
"rewards/accuracies": 0.4921875,
"rewards/chosen": 2.544921875,
"rewards/margins": 7.909375190734863,
"rewards/rejected": -5.3671875,
"step": 1050
},
{
"epoch": 0.49765258215962443,
"grad_norm": 252.3036001566129,
"learning_rate": 2.7934272300469483e-07,
"logits/chosen": -4.131249904632568,
"logits/rejected": -4.053124904632568,
"logps/chosen": -588.0,
"logps/rejected": -637.7999877929688,
"loss": 2.9657,
"rewards/accuracies": 0.4898437559604645,
"rewards/chosen": 2.487499952316284,
"rewards/margins": 7.415625095367432,
"rewards/rejected": -4.921875,
"step": 1060
},
{
"epoch": 0.5023474178403756,
"grad_norm": 254.32104609167183,
"learning_rate": 2.7673448095983303e-07,
"logits/chosen": -4.151562690734863,
"logits/rejected": -4.0859375,
"logps/chosen": -568.4000244140625,
"logps/rejected": -637.2000122070312,
"loss": 2.7111,
"rewards/accuracies": 0.49609375,
"rewards/chosen": 2.651562452316284,
"rewards/margins": 8.143750190734863,
"rewards/rejected": -5.495312690734863,
"step": 1070
},
{
"epoch": 0.5070422535211268,
"grad_norm": 295.27435523917325,
"learning_rate": 2.741262389149713e-07,
"logits/chosen": -4.170312404632568,
"logits/rejected": -4.001562595367432,
"logps/chosen": -568.4000244140625,
"logps/rejected": -658.7999877929688,
"loss": 3.0801,
"rewards/accuracies": 0.48906248807907104,
"rewards/chosen": 1.9158203601837158,
"rewards/margins": 8.071874618530273,
"rewards/rejected": -6.151562690734863,
"step": 1080
},
{
"epoch": 0.5117370892018779,
"grad_norm": 333.6479280985517,
"learning_rate": 2.7151799687010953e-07,
"logits/chosen": -4.1875,
"logits/rejected": -4.0625,
"logps/chosen": -575.5999755859375,
"logps/rejected": -661.5999755859375,
"loss": 2.9697,
"rewards/accuracies": 0.48906248807907104,
"rewards/chosen": 2.176953077316284,
"rewards/margins": 7.807812690734863,
"rewards/rejected": -5.626562595367432,
"step": 1090
},
{
"epoch": 0.5164319248826291,
"grad_norm": 247.17684499846777,
"learning_rate": 2.6890975482524773e-07,
"logits/chosen": -4.103125095367432,
"logits/rejected": -3.9749999046325684,
"logps/chosen": -593.4000244140625,
"logps/rejected": -651.7999877929688,
"loss": 2.7876,
"rewards/accuracies": 0.49921876192092896,
"rewards/chosen": 2.3265624046325684,
"rewards/margins": 8.818750381469727,
"rewards/rejected": -6.496874809265137,
"step": 1100
},
{
"epoch": 0.5211267605633803,
"grad_norm": 400.03065742916147,
"learning_rate": 2.66301512780386e-07,
"logits/chosen": -4.153124809265137,
"logits/rejected": -4.028124809265137,
"logps/chosen": -542.2000122070312,
"logps/rejected": -639.7999877929688,
"loss": 2.8744,
"rewards/accuracies": 0.48750001192092896,
"rewards/chosen": 2.279296875,
"rewards/margins": 9.290624618530273,
"rewards/rejected": -7.0078125,
"step": 1110
},
{
"epoch": 0.5258215962441315,
"grad_norm": 236.3522559902175,
"learning_rate": 2.6369327073552424e-07,
"logits/chosen": -4.209374904632568,
"logits/rejected": -4.106249809265137,
"logps/chosen": -551.5999755859375,
"logps/rejected": -615.7999877929688,
"loss": 2.6851,
"rewards/accuracies": 0.510937511920929,
"rewards/chosen": 2.870312452316284,
"rewards/margins": 7.959374904632568,
"rewards/rejected": -5.087500095367432,
"step": 1120
},
{
"epoch": 0.5305164319248826,
"grad_norm": 449.0784759609624,
"learning_rate": 2.6108502869066244e-07,
"logits/chosen": -4.168749809265137,
"logits/rejected": -4.073437690734863,
"logps/chosen": -583.2000122070312,
"logps/rejected": -682.0,
"loss": 3.18,
"rewards/accuracies": 0.503125011920929,
"rewards/chosen": 2.4398436546325684,
"rewards/margins": 7.62646484375,
"rewards/rejected": -5.1796875,
"step": 1130
},
{
"epoch": 0.5352112676056338,
"grad_norm": 356.684946953978,
"learning_rate": 2.584767866458007e-07,
"logits/chosen": -4.224999904632568,
"logits/rejected": -4.0625,
"logps/chosen": -558.5999755859375,
"logps/rejected": -641.5999755859375,
"loss": 2.7943,
"rewards/accuracies": 0.46953123807907104,
"rewards/chosen": 2.016796827316284,
"rewards/margins": 7.946875095367432,
"rewards/rejected": -5.923437595367432,
"step": 1140
},
{
"epoch": 0.539906103286385,
"grad_norm": 255.00420136519634,
"learning_rate": 2.5586854460093895e-07,
"logits/chosen": -4.168749809265137,
"logits/rejected": -4.0546875,
"logps/chosen": -568.4000244140625,
"logps/rejected": -667.5999755859375,
"loss": 2.9813,
"rewards/accuracies": 0.5179687738418579,
"rewards/chosen": 2.18115234375,
"rewards/margins": 8.71875,
"rewards/rejected": -6.525000095367432,
"step": 1150
},
{
"epoch": 0.5446009389671361,
"grad_norm": 246.04810826117472,
"learning_rate": 2.5326030255607715e-07,
"logits/chosen": -4.190625190734863,
"logits/rejected": -4.078125,
"logps/chosen": -574.2000122070312,
"logps/rejected": -651.5999755859375,
"loss": 3.0039,
"rewards/accuracies": 0.47968751192092896,
"rewards/chosen": 2.3734374046325684,
"rewards/margins": 7.978125095367432,
"rewards/rejected": -5.609765529632568,
"step": 1160
},
{
"epoch": 0.5492957746478874,
"grad_norm": 311.02323786782017,
"learning_rate": 2.506520605112154e-07,
"logits/chosen": -4.160937309265137,
"logits/rejected": -4.112500190734863,
"logps/chosen": -567.0,
"logps/rejected": -654.0,
"loss": 3.4351,
"rewards/accuracies": 0.4593749940395355,
"rewards/chosen": 1.73828125,
"rewards/margins": 6.778124809265137,
"rewards/rejected": -5.04296875,
"step": 1170
},
{
"epoch": 0.5539906103286385,
"grad_norm": 402.5987614392135,
"learning_rate": 2.4804381846635365e-07,
"logits/chosen": -4.221875190734863,
"logits/rejected": -4.131249904632568,
"logps/chosen": -583.2000122070312,
"logps/rejected": -644.0,
"loss": 3.0764,
"rewards/accuracies": 0.4632812440395355,
"rewards/chosen": 1.592187523841858,
"rewards/margins": 8.196874618530273,
"rewards/rejected": -6.609375,
"step": 1180
},
{
"epoch": 0.5586854460093896,
"grad_norm": 235.98510893801293,
"learning_rate": 2.454355764214919e-07,
"logits/chosen": -4.193749904632568,
"logits/rejected": -4.110937595367432,
"logps/chosen": -544.0,
"logps/rejected": -671.7999877929688,
"loss": 3.0112,
"rewards/accuracies": 0.47578126192092896,
"rewards/chosen": 1.999609351158142,
"rewards/margins": 8.028124809265137,
"rewards/rejected": -6.03125,
"step": 1190
},
{
"epoch": 0.5633802816901409,
"grad_norm": 2471.375555054977,
"learning_rate": 2.4282733437663016e-07,
"logits/chosen": -4.206250190734863,
"logits/rejected": -4.157812595367432,
"logps/chosen": -574.4000244140625,
"logps/rejected": -628.4000244140625,
"loss": 2.7524,
"rewards/accuracies": 0.4789062440395355,
"rewards/chosen": 3.109375,
"rewards/margins": 7.653124809265137,
"rewards/rejected": -4.545312404632568,
"step": 1200
},
{
"epoch": 0.568075117370892,
"grad_norm": 254.88303513035962,
"learning_rate": 2.4021909233176836e-07,
"logits/chosen": -4.168749809265137,
"logits/rejected": -4.099999904632568,
"logps/chosen": -538.7999877929688,
"logps/rejected": -649.5999755859375,
"loss": 2.5376,
"rewards/accuracies": 0.45234376192092896,
"rewards/chosen": 2.389843702316284,
"rewards/margins": 8.425000190734863,
"rewards/rejected": -6.039453029632568,
"step": 1210
},
{
"epoch": 0.5727699530516432,
"grad_norm": 291.0218011211237,
"learning_rate": 2.376108502869066e-07,
"logits/chosen": -4.193749904632568,
"logits/rejected": -4.146874904632568,
"logps/chosen": -575.5999755859375,
"logps/rejected": -673.0,
"loss": 2.5853,
"rewards/accuracies": 0.4945312440395355,
"rewards/chosen": 2.547656297683716,
"rewards/margins": 7.704687595367432,
"rewards/rejected": -5.163281440734863,
"step": 1220
},
{
"epoch": 0.5774647887323944,
"grad_norm": 294.9902995268332,
"learning_rate": 2.3500260824204484e-07,
"logits/chosen": -4.134375095367432,
"logits/rejected": -4.028124809265137,
"logps/chosen": -603.2000122070312,
"logps/rejected": -683.2000122070312,
"loss": 3.4254,
"rewards/accuracies": 0.4976562559604645,
"rewards/chosen": 1.564843773841858,
"rewards/margins": 8.621874809265137,
"rewards/rejected": -7.060937404632568,
"step": 1230
},
{
"epoch": 0.5821596244131455,
"grad_norm": 243.17738458688876,
"learning_rate": 2.323943661971831e-07,
"logits/chosen": -4.237500190734863,
"logits/rejected": -4.121874809265137,
"logps/chosen": -563.2000122070312,
"logps/rejected": -642.0,
"loss": 3.0896,
"rewards/accuracies": 0.4906249940395355,
"rewards/chosen": 2.217968702316284,
"rewards/margins": 8.28125,
"rewards/rejected": -6.0625,
"step": 1240
},
{
"epoch": 0.5868544600938967,
"grad_norm": 279.18184598229146,
"learning_rate": 2.2978612415232132e-07,
"logits/chosen": -4.190625190734863,
"logits/rejected": -4.099999904632568,
"logps/chosen": -595.5999755859375,
"logps/rejected": -672.4000244140625,
"loss": 2.9207,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 2.26953125,
"rewards/margins": 7.4375,
"rewards/rejected": -5.176562309265137,
"step": 1250
},
{
"epoch": 0.5915492957746479,
"grad_norm": 248.25515971211874,
"learning_rate": 2.2717788210745957e-07,
"logits/chosen": -4.190625190734863,
"logits/rejected": -4.0625,
"logps/chosen": -557.0,
"logps/rejected": -658.7999877929688,
"loss": 2.7618,
"rewards/accuracies": 0.4828124940395355,
"rewards/chosen": 2.1996092796325684,
"rewards/margins": 8.904687881469727,
"rewards/rejected": -6.709374904632568,
"step": 1260
},
{
"epoch": 0.596244131455399,
"grad_norm": 254.76169280573018,
"learning_rate": 2.245696400625978e-07,
"logits/chosen": -4.224999904632568,
"logits/rejected": -4.107812404632568,
"logps/chosen": -587.4000244140625,
"logps/rejected": -665.7999877929688,
"loss": 3.5291,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 1.740332007408142,
"rewards/margins": 7.653124809265137,
"rewards/rejected": -5.912499904632568,
"step": 1270
},
{
"epoch": 0.6009389671361502,
"grad_norm": 238.04558401923484,
"learning_rate": 2.2196139801773602e-07,
"logits/chosen": -4.153124809265137,
"logits/rejected": -4.018750190734863,
"logps/chosen": -552.2000122070312,
"logps/rejected": -624.2000122070312,
"loss": 3.1411,
"rewards/accuracies": 0.48359376192092896,
"rewards/chosen": 1.81640625,
"rewards/margins": 7.315625190734863,
"rewards/rejected": -5.5,
"step": 1280
},
{
"epoch": 0.6056338028169014,
"grad_norm": 358.6362771378,
"learning_rate": 2.1935315597287428e-07,
"logits/chosen": -4.15625,
"logits/rejected": -4.076562404632568,
"logps/chosen": -571.0,
"logps/rejected": -623.5999755859375,
"loss": 2.9957,
"rewards/accuracies": 0.507031261920929,
"rewards/chosen": 2.0546875,
"rewards/margins": 7.315625190734863,
"rewards/rejected": -5.265625,
"step": 1290
},
{
"epoch": 0.6103286384976526,
"grad_norm": 223.73969039337766,
"learning_rate": 2.167449139280125e-07,
"logits/chosen": -4.190625190734863,
"logits/rejected": -4.073437690734863,
"logps/chosen": -577.2000122070312,
"logps/rejected": -666.0,
"loss": 2.8525,
"rewards/accuracies": 0.49140626192092896,
"rewards/chosen": 2.350781202316284,
"rewards/margins": 8.157812118530273,
"rewards/rejected": -5.814062595367432,
"step": 1300
},
{
"epoch": 0.6150234741784038,
"grad_norm": 259.1197329772539,
"learning_rate": 2.1413667188315073e-07,
"logits/chosen": -4.237500190734863,
"logits/rejected": -4.224999904632568,
"logps/chosen": -547.2000122070312,
"logps/rejected": -612.4000244140625,
"loss": 2.993,
"rewards/accuracies": 0.4937500059604645,
"rewards/chosen": 2.399609327316284,
"rewards/margins": 7.756249904632568,
"rewards/rejected": -5.3515625,
"step": 1310
},
{
"epoch": 0.6197183098591549,
"grad_norm": 267.20628690442504,
"learning_rate": 2.1152842983828898e-07,
"logits/chosen": -4.123437404632568,
"logits/rejected": -4.040625095367432,
"logps/chosen": -579.2000122070312,
"logps/rejected": -640.4000244140625,
"loss": 3.6735,
"rewards/accuracies": 0.48515623807907104,
"rewards/chosen": 1.484765648841858,
"rewards/margins": 6.603320121765137,
"rewards/rejected": -5.123827934265137,
"step": 1320
},
{
"epoch": 0.6244131455399061,
"grad_norm": 256.25318165207995,
"learning_rate": 2.089201877934272e-07,
"logits/chosen": -4.131249904632568,
"logits/rejected": -4.043749809265137,
"logps/chosen": -592.0,
"logps/rejected": -689.7999877929688,
"loss": 3.2943,
"rewards/accuracies": 0.5023437738418579,
"rewards/chosen": 1.5166504383087158,
"rewards/margins": 10.184374809265137,
"rewards/rejected": -8.668749809265137,
"step": 1330
},
{
"epoch": 0.6291079812206573,
"grad_norm": 334.35995211244534,
"learning_rate": 2.0631194574856543e-07,
"logits/chosen": -4.220312595367432,
"logits/rejected": -4.143750190734863,
"logps/chosen": -547.0,
"logps/rejected": -593.7999877929688,
"loss": 2.622,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 2.6078124046325684,
"rewards/margins": 6.675000190734863,
"rewards/rejected": -4.064062595367432,
"step": 1340
},
{
"epoch": 0.6338028169014085,
"grad_norm": 291.95519056678296,
"learning_rate": 2.0370370370370369e-07,
"logits/chosen": -4.112500190734863,
"logits/rejected": -4.048437595367432,
"logps/chosen": -572.4000244140625,
"logps/rejected": -691.2000122070312,
"loss": 3.244,
"rewards/accuracies": 0.4828124940395355,
"rewards/chosen": 1.5021483898162842,
"rewards/margins": 7.981249809265137,
"rewards/rejected": -6.486718654632568,
"step": 1350
},
{
"epoch": 0.6384976525821596,
"grad_norm": 267.81172219110795,
"learning_rate": 2.010954616588419e-07,
"logits/chosen": -4.206250190734863,
"logits/rejected": -4.0703125,
"logps/chosen": -559.7999877929688,
"logps/rejected": -640.0,
"loss": 2.825,
"rewards/accuracies": 0.5,
"rewards/chosen": 2.4400391578674316,
"rewards/margins": 8.28125,
"rewards/rejected": -5.84375,
"step": 1360
},
{
"epoch": 0.6431924882629108,
"grad_norm": 268.8924951378491,
"learning_rate": 1.9848721961398017e-07,
"logits/chosen": -4.224999904632568,
"logits/rejected": -4.154687404632568,
"logps/chosen": -568.5999755859375,
"logps/rejected": -625.2000122070312,
"loss": 2.9559,
"rewards/accuracies": 0.4609375,
"rewards/chosen": 2.38671875,
"rewards/margins": 7.073437690734863,
"rewards/rejected": -4.682812690734863,
"step": 1370
},
{
"epoch": 0.647887323943662,
"grad_norm": 248.8386074500955,
"learning_rate": 1.958789775691184e-07,
"logits/chosen": -4.173437595367432,
"logits/rejected": -4.051562309265137,
"logps/chosen": -553.7999877929688,
"logps/rejected": -643.2000122070312,
"loss": 2.5208,
"rewards/accuracies": 0.4921875,
"rewards/chosen": 2.358203172683716,
"rewards/margins": 8.321874618530273,
"rewards/rejected": -5.971093654632568,
"step": 1380
},
{
"epoch": 0.6525821596244131,
"grad_norm": 234.82733297662526,
"learning_rate": 1.9327073552425662e-07,
"logits/chosen": -4.162499904632568,
"logits/rejected": -4.081250190734863,
"logps/chosen": -545.0,
"logps/rejected": -616.7999877929688,
"loss": 2.687,
"rewards/accuracies": 0.5093749761581421,
"rewards/chosen": 2.634765625,
"rewards/margins": 8.293749809265137,
"rewards/rejected": -5.66015625,
"step": 1390
},
{
"epoch": 0.6572769953051644,
"grad_norm": 310.18784061012275,
"learning_rate": 1.906624934793949e-07,
"logits/chosen": -4.1640625,
"logits/rejected": -4.123437404632568,
"logps/chosen": -564.7999877929688,
"logps/rejected": -673.2000122070312,
"loss": 2.9459,
"rewards/accuracies": 0.504687488079071,
"rewards/chosen": 2.4751954078674316,
"rewards/margins": 9.300000190734863,
"rewards/rejected": -6.834374904632568,
"step": 1400
},
{
"epoch": 0.6619718309859155,
"grad_norm": 235.4558018667043,
"learning_rate": 1.8805425143453312e-07,
"logits/chosen": -4.206250190734863,
"logits/rejected": -4.003125190734863,
"logps/chosen": -543.4000244140625,
"logps/rejected": -701.2000122070312,
"loss": 2.668,
"rewards/accuracies": 0.48750001192092896,
"rewards/chosen": 2.913281202316284,
"rewards/margins": 9.1875,
"rewards/rejected": -6.278124809265137,
"step": 1410
},
{
"epoch": 0.6666666666666666,
"grad_norm": 293.41852691409196,
"learning_rate": 1.8544600938967138e-07,
"logits/chosen": -4.184374809265137,
"logits/rejected": -4.092187404632568,
"logps/chosen": -561.5999755859375,
"logps/rejected": -628.0,
"loss": 2.8252,
"rewards/accuracies": 0.4906249940395355,
"rewards/chosen": 2.319531202316284,
"rewards/margins": 7.837500095367432,
"rewards/rejected": -5.506249904632568,
"step": 1420
},
{
"epoch": 0.6713615023474179,
"grad_norm": 318.8082210935934,
"learning_rate": 1.828377673448096e-07,
"logits/chosen": -4.143750190734863,
"logits/rejected": -4.087500095367432,
"logps/chosen": -598.4000244140625,
"logps/rejected": -649.5999755859375,
"loss": 3.9709,
"rewards/accuracies": 0.4906249940395355,
"rewards/chosen": 1.078125,
"rewards/margins": 7.635937690734863,
"rewards/rejected": -6.553124904632568,
"step": 1430
},
{
"epoch": 0.676056338028169,
"grad_norm": 214.52983321408703,
"learning_rate": 1.8022952529994783e-07,
"logits/chosen": -4.182812690734863,
"logits/rejected": -4.057812690734863,
"logps/chosen": -573.4000244140625,
"logps/rejected": -639.0,
"loss": 2.6869,
"rewards/accuracies": 0.5015624761581421,
"rewards/chosen": 2.2164063453674316,
"rewards/margins": 9.912500381469727,
"rewards/rejected": -7.698437690734863,
"step": 1440
},
{
"epoch": 0.6807511737089202,
"grad_norm": 535.5466031773983,
"learning_rate": 1.7762128325508608e-07,
"logits/chosen": -4.215624809265137,
"logits/rejected": -4.099999904632568,
"logps/chosen": -583.0,
"logps/rejected": -685.5999755859375,
"loss": 3.44,
"rewards/accuracies": 0.4593749940395355,
"rewards/chosen": 1.505712866783142,
"rewards/margins": 8.571874618530273,
"rewards/rejected": -7.068749904632568,
"step": 1450
},
{
"epoch": 0.6854460093896714,
"grad_norm": 286.387097411706,
"learning_rate": 1.750130412102243e-07,
"logits/chosen": -4.112500190734863,
"logits/rejected": -4.050000190734863,
"logps/chosen": -612.7999877929688,
"logps/rejected": -664.0,
"loss": 3.4718,
"rewards/accuracies": 0.48750001192092896,
"rewards/chosen": 1.973486304283142,
"rewards/margins": 8.126562118530273,
"rewards/rejected": -6.159375190734863,
"step": 1460
},
{
"epoch": 0.6901408450704225,
"grad_norm": 251.16006508160885,
"learning_rate": 1.7240479916536254e-07,
"logits/chosen": -4.110937595367432,
"logits/rejected": -4.043749809265137,
"logps/chosen": -551.5999755859375,
"logps/rejected": -679.2000122070312,
"loss": 2.9329,
"rewards/accuracies": 0.504687488079071,
"rewards/chosen": 2.4937500953674316,
"rewards/margins": 9.625,
"rewards/rejected": -7.120312690734863,
"step": 1470
},
{
"epoch": 0.6948356807511737,
"grad_norm": 247.36057065543977,
"learning_rate": 1.697965571205008e-07,
"logits/chosen": -4.209374904632568,
"logits/rejected": -4.123437404632568,
"logps/chosen": -560.0,
"logps/rejected": -618.4000244140625,
"loss": 3.0374,
"rewards/accuracies": 0.4859375059604645,
"rewards/chosen": 2.0550780296325684,
"rewards/margins": 7.790625095367432,
"rewards/rejected": -5.721875190734863,
"step": 1480
},
{
"epoch": 0.6995305164319249,
"grad_norm": 264.09934191241626,
"learning_rate": 1.6718831507563902e-07,
"logits/chosen": -4.178124904632568,
"logits/rejected": -4.128125190734863,
"logps/chosen": -565.5999755859375,
"logps/rejected": -610.5999755859375,
"loss": 2.8288,
"rewards/accuracies": 0.4906249940395355,
"rewards/chosen": 2.4937500953674316,
"rewards/margins": 7.323437690734863,
"rewards/rejected": -4.831250190734863,
"step": 1490
},
{
"epoch": 0.704225352112676,
"grad_norm": 237.52384616511833,
"learning_rate": 1.6458007303077727e-07,
"logits/chosen": -4.181250095367432,
"logits/rejected": -4.099999904632568,
"logps/chosen": -553.0,
"logps/rejected": -622.0,
"loss": 2.7071,
"rewards/accuracies": 0.5054687261581421,
"rewards/chosen": 2.0841307640075684,
"rewards/margins": 6.650000095367432,
"rewards/rejected": -4.560937404632568,
"step": 1500
},
{
"epoch": 0.7089201877934272,
"grad_norm": 254.89751638831584,
"learning_rate": 1.619718309859155e-07,
"logits/chosen": -4.199999809265137,
"logits/rejected": -4.073437690734863,
"logps/chosen": -573.7999877929688,
"logps/rejected": -673.5999755859375,
"loss": 2.9881,
"rewards/accuracies": 0.4921875,
"rewards/chosen": 2.4203124046325684,
"rewards/margins": 7.485937595367432,
"rewards/rejected": -5.064062595367432,
"step": 1510
},
{
"epoch": 0.7136150234741784,
"grad_norm": 242.02433017820204,
"learning_rate": 1.5936358894105372e-07,
"logits/chosen": -4.212500095367432,
"logits/rejected": -4.109375,
"logps/chosen": -574.0,
"logps/rejected": -659.5999755859375,
"loss": 2.6569,
"rewards/accuracies": 0.4976562559604645,
"rewards/chosen": 2.555468797683716,
"rewards/margins": 9.290624618530273,
"rewards/rejected": -6.743750095367432,
"step": 1520
},
{
"epoch": 0.7183098591549296,
"grad_norm": 204.12681215097106,
"learning_rate": 1.5675534689619197e-07,
"logits/chosen": -4.190625190734863,
"logits/rejected": -4.135937690734863,
"logps/chosen": -574.0,
"logps/rejected": -606.7999877929688,
"loss": 2.8257,
"rewards/accuracies": 0.48515623807907104,
"rewards/chosen": 1.885156273841858,
"rewards/margins": 7.301562309265137,
"rewards/rejected": -5.4140625,
"step": 1530
},
{
"epoch": 0.7230046948356808,
"grad_norm": 220.69702921039521,
"learning_rate": 1.541471048513302e-07,
"logits/chosen": -4.1875,
"logits/rejected": -4.104687690734863,
"logps/chosen": -574.0,
"logps/rejected": -648.4000244140625,
"loss": 2.9706,
"rewards/accuracies": 0.504687488079071,
"rewards/chosen": 2.0511474609375,
"rewards/margins": 7.868750095367432,
"rewards/rejected": -5.821875095367432,
"step": 1540
},
{
"epoch": 0.7276995305164319,
"grad_norm": 233.43235168168627,
"learning_rate": 1.5153886280646843e-07,
"logits/chosen": -4.190625190734863,
"logits/rejected": -4.125,
"logps/chosen": -531.7999877929688,
"logps/rejected": -597.0,
"loss": 2.9134,
"rewards/accuracies": 0.4976562559604645,
"rewards/chosen": 2.35546875,
"rewards/margins": 7.579687595367432,
"rewards/rejected": -5.2265625,
"step": 1550
},
{
"epoch": 0.7323943661971831,
"grad_norm": 242.69092831621717,
"learning_rate": 1.4893062076160668e-07,
"logits/chosen": -4.199999809265137,
"logits/rejected": -4.125,
"logps/chosen": -562.4000244140625,
"logps/rejected": -658.4000244140625,
"loss": 2.895,
"rewards/accuracies": 0.4976562559604645,
"rewards/chosen": 2.4921875,
"rewards/margins": 9.215624809265137,
"rewards/rejected": -6.720312595367432,
"step": 1560
},
{
"epoch": 0.7370892018779343,
"grad_norm": 208.19593737431086,
"learning_rate": 1.463223787167449e-07,
"logits/chosen": -4.212500095367432,
"logits/rejected": -4.107812404632568,
"logps/chosen": -574.7999877929688,
"logps/rejected": -638.7999877929688,
"loss": 3.2961,
"rewards/accuracies": 0.47734373807907104,
"rewards/chosen": 1.5167968273162842,
"rewards/margins": 7.256249904632568,
"rewards/rejected": -5.734375,
"step": 1570
},
{
"epoch": 0.7417840375586855,
"grad_norm": 310.0166836408286,
"learning_rate": 1.4371413667188313e-07,
"logits/chosen": -4.21875,
"logits/rejected": -4.065625190734863,
"logps/chosen": -559.5999755859375,
"logps/rejected": -678.4000244140625,
"loss": 2.7786,
"rewards/accuracies": 0.49531251192092896,
"rewards/chosen": 2.492968797683716,
"rewards/margins": 9.278124809265137,
"rewards/rejected": -6.790625095367432,
"step": 1580
},
{
"epoch": 0.7464788732394366,
"grad_norm": 264.08280499875406,
"learning_rate": 1.4110589462702139e-07,
"logits/chosen": -4.237500190734863,
"logits/rejected": -4.145312309265137,
"logps/chosen": -556.4000244140625,
"logps/rejected": -620.2000122070312,
"loss": 2.9828,
"rewards/accuracies": 0.48359376192092896,
"rewards/chosen": 2.3646483421325684,
"rewards/margins": 7.588281154632568,
"rewards/rejected": -5.2265625,
"step": 1590
},
{
"epoch": 0.7511737089201878,
"grad_norm": 261.50016438802686,
"learning_rate": 1.384976525821596e-07,
"logits/chosen": -4.262499809265137,
"logits/rejected": -4.110937595367432,
"logps/chosen": -576.0,
"logps/rejected": -670.5999755859375,
"loss": 2.7417,
"rewards/accuracies": 0.510937511920929,
"rewards/chosen": 2.551953077316284,
"rewards/margins": 9.550000190734863,
"rewards/rejected": -6.9921875,
"step": 1600
},
{
"epoch": 0.755868544600939,
"grad_norm": 293.0794110532751,
"learning_rate": 1.3588941053729787e-07,
"logits/chosen": -4.171875,
"logits/rejected": -4.120312690734863,
"logps/chosen": -578.0,
"logps/rejected": -667.2000122070312,
"loss": 3.0631,
"rewards/accuracies": 0.5101562738418579,
"rewards/chosen": 2.7017579078674316,
"rewards/margins": 9.087499618530273,
"rewards/rejected": -6.387499809265137,
"step": 1610
},
{
"epoch": 0.7605633802816901,
"grad_norm": 263.46147273147955,
"learning_rate": 1.332811684924361e-07,
"logits/chosen": -4.181250095367432,
"logits/rejected": -4.084374904632568,
"logps/chosen": -585.4000244140625,
"logps/rejected": -646.0,
"loss": 3.5318,
"rewards/accuracies": 0.4921875,
"rewards/chosen": 1.736328125,
"rewards/margins": 7.243750095367432,
"rewards/rejected": -5.504687309265137,
"step": 1620
},
{
"epoch": 0.7652582159624414,
"grad_norm": 264.0354478252828,
"learning_rate": 1.3067292644757432e-07,
"logits/chosen": -4.114062309265137,
"logits/rejected": -4.040625095367432,
"logps/chosen": -588.5999755859375,
"logps/rejected": -686.7999877929688,
"loss": 2.6745,
"rewards/accuracies": 0.5140625238418579,
"rewards/chosen": 2.123046875,
"rewards/margins": 9.359375,
"rewards/rejected": -7.239062309265137,
"step": 1630
},
{
"epoch": 0.7699530516431925,
"grad_norm": 338.5060307146247,
"learning_rate": 1.2806468440271257e-07,
"logits/chosen": -4.196875095367432,
"logits/rejected": -4.099999904632568,
"logps/chosen": -549.0,
"logps/rejected": -630.2000122070312,
"loss": 2.7684,
"rewards/accuracies": 0.508593738079071,
"rewards/chosen": 2.6273436546325684,
"rewards/margins": 7.606249809265137,
"rewards/rejected": -4.98046875,
"step": 1640
},
{
"epoch": 0.7746478873239436,
"grad_norm": 222.14397678530307,
"learning_rate": 1.254564423578508e-07,
"logits/chosen": -4.206250190734863,
"logits/rejected": -4.089062690734863,
"logps/chosen": -556.7999877929688,
"logps/rejected": -640.0,
"loss": 2.639,
"rewards/accuracies": 0.507031261920929,
"rewards/chosen": 2.7789063453674316,
"rewards/margins": 9.15625,
"rewards/rejected": -6.387499809265137,
"step": 1650
},
{
"epoch": 0.7793427230046949,
"grad_norm": 283.2056849330329,
"learning_rate": 1.2284820031298902e-07,
"logits/chosen": -4.184374809265137,
"logits/rejected": -4.073437690734863,
"logps/chosen": -595.5999755859375,
"logps/rejected": -668.7999877929688,
"loss": 2.9856,
"rewards/accuracies": 0.5132812261581421,
"rewards/chosen": 2.751171827316284,
"rewards/margins": 9.5,
"rewards/rejected": -6.7421875,
"step": 1660
},
{
"epoch": 0.784037558685446,
"grad_norm": 292.4005754799325,
"learning_rate": 1.2023995826812728e-07,
"logits/chosen": -4.1875,
"logits/rejected": -4.0546875,
"logps/chosen": -560.4000244140625,
"logps/rejected": -654.0,
"loss": 2.7566,
"rewards/accuracies": 0.49296873807907104,
"rewards/chosen": 2.155956983566284,
"rewards/margins": 8.618749618530273,
"rewards/rejected": -6.462890625,
"step": 1670
},
{
"epoch": 0.7887323943661971,
"grad_norm": 271.92643509309005,
"learning_rate": 1.176317162232655e-07,
"logits/chosen": -4.1875,
"logits/rejected": -4.09375,
"logps/chosen": -556.4000244140625,
"logps/rejected": -665.0,
"loss": 2.3201,
"rewards/accuracies": 0.4867187440395355,
"rewards/chosen": 2.27734375,
"rewards/margins": 8.940625190734863,
"rewards/rejected": -6.668749809265137,
"step": 1680
},
{
"epoch": 0.7934272300469484,
"grad_norm": 217.20947043092823,
"learning_rate": 1.1502347417840374e-07,
"logits/chosen": -4.145312309265137,
"logits/rejected": -4.0546875,
"logps/chosen": -563.4000244140625,
"logps/rejected": -647.2000122070312,
"loss": 3.0267,
"rewards/accuracies": 0.49687498807907104,
"rewards/chosen": 1.9630858898162842,
"rewards/margins": 8.449999809265137,
"rewards/rejected": -6.493750095367432,
"step": 1690
},
{
"epoch": 0.7981220657276995,
"grad_norm": 268.4501537506006,
"learning_rate": 1.1241523213354198e-07,
"logits/chosen": -4.221875190734863,
"logits/rejected": -4.081250190734863,
"logps/chosen": -563.2000122070312,
"logps/rejected": -670.7999877929688,
"loss": 2.5566,
"rewards/accuracies": 0.51953125,
"rewards/chosen": 2.8046875,
"rewards/margins": 9.712499618530273,
"rewards/rejected": -6.907812595367432,
"step": 1700
},
{
"epoch": 0.8028169014084507,
"grad_norm": 228.66370177088228,
"learning_rate": 1.0980699008868022e-07,
"logits/chosen": -4.1796875,
"logits/rejected": -4.092187404632568,
"logps/chosen": -576.7999877929688,
"logps/rejected": -632.4000244140625,
"loss": 2.9308,
"rewards/accuracies": 0.5023437738418579,
"rewards/chosen": 2.1919922828674316,
"rewards/margins": 8.440625190734863,
"rewards/rejected": -6.240624904632568,
"step": 1710
},
{
"epoch": 0.8075117370892019,
"grad_norm": 262.1967296178448,
"learning_rate": 1.0719874804381846e-07,
"logits/chosen": -4.168749809265137,
"logits/rejected": -4.098437309265137,
"logps/chosen": -557.4000244140625,
"logps/rejected": -598.7999877929688,
"loss": 2.7061,
"rewards/accuracies": 0.507031261920929,
"rewards/chosen": 2.848828077316284,
"rewards/margins": 7.423437595367432,
"rewards/rejected": -4.579687595367432,
"step": 1720
},
{
"epoch": 0.812206572769953,
"grad_norm": 232.10360746298278,
"learning_rate": 1.045905059989567e-07,
"logits/chosen": -4.206250190734863,
"logits/rejected": -4.162499904632568,
"logps/chosen": -533.2000122070312,
"logps/rejected": -592.0,
"loss": 2.5252,
"rewards/accuracies": 0.47968751192092896,
"rewards/chosen": 2.7535157203674316,
"rewards/margins": 7.306250095367432,
"rewards/rejected": -4.551562309265137,
"step": 1730
},
{
"epoch": 0.8169014084507042,
"grad_norm": 264.2413834021659,
"learning_rate": 1.0198226395409494e-07,
"logits/chosen": -4.181250095367432,
"logits/rejected": -4.059374809265137,
"logps/chosen": -541.4000244140625,
"logps/rejected": -615.5999755859375,
"loss": 3.0827,
"rewards/accuracies": 0.49531251192092896,
"rewards/chosen": 1.441796898841858,
"rewards/margins": 7.021874904632568,
"rewards/rejected": -5.579687595367432,
"step": 1740
},
{
"epoch": 0.8215962441314554,
"grad_norm": 243.0050739142313,
"learning_rate": 9.937402190923318e-08,
"logits/chosen": -4.170312404632568,
"logits/rejected": -4.081250190734863,
"logps/chosen": -530.4000244140625,
"logps/rejected": -656.4000244140625,
"loss": 2.6591,
"rewards/accuracies": 0.49140626192092896,
"rewards/chosen": 2.4921875,
"rewards/margins": 10.149999618530273,
"rewards/rejected": -7.654687404632568,
"step": 1750
},
{
"epoch": 0.8262910798122066,
"grad_norm": 263.15989334134304,
"learning_rate": 9.676577986437141e-08,
"logits/chosen": -4.131249904632568,
"logits/rejected": -4.014062404632568,
"logps/chosen": -590.7999877929688,
"logps/rejected": -647.5999755859375,
"loss": 3.2525,
"rewards/accuracies": 0.503125011920929,
"rewards/chosen": 2.1201171875,
"rewards/margins": 9.371874809265137,
"rewards/rejected": -7.251562595367432,
"step": 1760
},
{
"epoch": 0.8309859154929577,
"grad_norm": 205.3515680856732,
"learning_rate": 9.415753781950965e-08,
"logits/chosen": -4.1875,
"logits/rejected": -4.110937595367432,
"logps/chosen": -544.7999877929688,
"logps/rejected": -637.5999755859375,
"loss": 2.3893,
"rewards/accuracies": 0.503125011920929,
"rewards/chosen": 2.53515625,
"rewards/margins": 9.024999618530273,
"rewards/rejected": -6.481249809265137,
"step": 1770
},
{
"epoch": 0.8356807511737089,
"grad_norm": 255.00260836835142,
"learning_rate": 9.154929577464789e-08,
"logits/chosen": -4.184374809265137,
"logits/rejected": -4.057812690734863,
"logps/chosen": -562.4000244140625,
"logps/rejected": -640.0,
"loss": 2.8412,
"rewards/accuracies": 0.5093749761581421,
"rewards/chosen": 2.246875047683716,
"rewards/margins": 8.6875,
"rewards/rejected": -6.451562404632568,
"step": 1780
},
{
"epoch": 0.8403755868544601,
"grad_norm": 306.071482107185,
"learning_rate": 8.894105372978613e-08,
"logits/chosen": -4.162499904632568,
"logits/rejected": -4.081250190734863,
"logps/chosen": -581.0,
"logps/rejected": -648.5999755859375,
"loss": 2.9228,
"rewards/accuracies": 0.47968751192092896,
"rewards/chosen": 2.34765625,
"rewards/margins": 8.464062690734863,
"rewards/rejected": -6.127343654632568,
"step": 1790
},
{
"epoch": 0.8450704225352113,
"grad_norm": 254.95417180264684,
"learning_rate": 8.633281168492435e-08,
"logits/chosen": -4.221875190734863,
"logits/rejected": -4.165625095367432,
"logps/chosen": -559.5999755859375,
"logps/rejected": -628.5999755859375,
"loss": 2.6415,
"rewards/accuracies": 0.5132812261581421,
"rewards/chosen": 2.3984375,
"rewards/margins": 8.803125381469727,
"rewards/rejected": -6.410937309265137,
"step": 1800
},
{
"epoch": 0.8497652582159625,
"grad_norm": 322.4975617997682,
"learning_rate": 8.372456964006259e-08,
"logits/chosen": -4.1484375,
"logits/rejected": -4.051562309265137,
"logps/chosen": -555.0,
"logps/rejected": -640.4000244140625,
"loss": 3.0295,
"rewards/accuracies": 0.51171875,
"rewards/chosen": 1.8380858898162842,
"rewards/margins": 9.334375381469727,
"rewards/rejected": -7.485937595367432,
"step": 1810
},
{
"epoch": 0.8544600938967136,
"grad_norm": 333.75848335478094,
"learning_rate": 8.111632759520083e-08,
"logits/chosen": -4.143750190734863,
"logits/rejected": -4.092187404632568,
"logps/chosen": -603.2000122070312,
"logps/rejected": -660.7999877929688,
"loss": 2.7073,
"rewards/accuracies": 0.518750011920929,
"rewards/chosen": 2.360156297683716,
"rewards/margins": 9.676562309265137,
"rewards/rejected": -7.326562404632568,
"step": 1820
},
{
"epoch": 0.8591549295774648,
"grad_norm": 773.9494252353215,
"learning_rate": 7.850808555033907e-08,
"logits/chosen": -4.150000095367432,
"logits/rejected": -4.032812595367432,
"logps/chosen": -564.0,
"logps/rejected": -665.2000122070312,
"loss": 2.621,
"rewards/accuracies": 0.5093749761581421,
"rewards/chosen": 2.0914063453674316,
"rewards/margins": 10.021875381469727,
"rewards/rejected": -7.934374809265137,
"step": 1830
},
{
"epoch": 0.863849765258216,
"grad_norm": 261.68841557963896,
"learning_rate": 7.58998435054773e-08,
"logits/chosen": -4.15625,
"logits/rejected": -4.051562309265137,
"logps/chosen": -582.4000244140625,
"logps/rejected": -662.0,
"loss": 3.2356,
"rewards/accuracies": 0.4828124940395355,
"rewards/chosen": 1.8888671398162842,
"rewards/margins": 8.040624618530273,
"rewards/rejected": -6.140625,
"step": 1840
},
{
"epoch": 0.8685446009389671,
"grad_norm": 293.68613390890863,
"learning_rate": 7.329160146061554e-08,
"logits/chosen": -4.212500095367432,
"logits/rejected": -4.196875095367432,
"logps/chosen": -552.0,
"logps/rejected": -644.0,
"loss": 3.0956,
"rewards/accuracies": 0.504687488079071,
"rewards/chosen": 2.5859375,
"rewards/margins": 8.465624809265137,
"rewards/rejected": -5.879687309265137,
"step": 1850
},
{
"epoch": 0.8732394366197183,
"grad_norm": 266.81714304493767,
"learning_rate": 7.068335941575378e-08,
"logits/chosen": -4.146874904632568,
"logits/rejected": -4.1015625,
"logps/chosen": -552.5999755859375,
"logps/rejected": -623.2000122070312,
"loss": 3.391,
"rewards/accuracies": 0.503125011920929,
"rewards/chosen": 1.478906273841858,
"rewards/margins": 9.1171875,
"rewards/rejected": -7.624218940734863,
"step": 1860
},
{
"epoch": 0.8779342723004695,
"grad_norm": 270.92543752460966,
"learning_rate": 6.807511737089202e-08,
"logits/chosen": -4.231249809265137,
"logits/rejected": -4.112500190734863,
"logps/chosen": -549.5999755859375,
"logps/rejected": -642.4000244140625,
"loss": 2.8628,
"rewards/accuracies": 0.504687488079071,
"rewards/chosen": 2.350146532058716,
"rewards/margins": 9.634374618530273,
"rewards/rejected": -7.279687404632568,
"step": 1870
},
{
"epoch": 0.8826291079812206,
"grad_norm": 250.02424304627982,
"learning_rate": 6.546687532603024e-08,
"logits/chosen": -4.199999809265137,
"logits/rejected": -4.079687595367432,
"logps/chosen": -556.5999755859375,
"logps/rejected": -651.2000122070312,
"loss": 2.6825,
"rewards/accuracies": 0.4984374940395355,
"rewards/chosen": 2.0291991233825684,
"rewards/margins": 7.84375,
"rewards/rejected": -5.8046875,
"step": 1880
},
{
"epoch": 0.8873239436619719,
"grad_norm": 231.36542794007647,
"learning_rate": 6.285863328116848e-08,
"logits/chosen": -4.215624809265137,
"logits/rejected": -4.103125095367432,
"logps/chosen": -511.20001220703125,
"logps/rejected": -661.5999755859375,
"loss": 2.6862,
"rewards/accuracies": 0.5062500238418579,
"rewards/chosen": 2.270312547683716,
"rewards/margins": 8.731249809265137,
"rewards/rejected": -6.454687595367432,
"step": 1890
},
{
"epoch": 0.892018779342723,
"grad_norm": 280.50166200715563,
"learning_rate": 6.025039123630672e-08,
"logits/chosen": -4.178124904632568,
"logits/rejected": -4.084374904632568,
"logps/chosen": -576.0,
"logps/rejected": -615.5999755859375,
"loss": 2.8327,
"rewards/accuracies": 0.48906248807907104,
"rewards/chosen": 2.594921827316284,
"rewards/margins": 8.024999618530273,
"rewards/rejected": -5.434374809265137,
"step": 1900
},
{
"epoch": 0.8967136150234741,
"grad_norm": 214.81430839966447,
"learning_rate": 5.764214919144496e-08,
"logits/chosen": -4.181250095367432,
"logits/rejected": -4.128125190734863,
"logps/chosen": -579.2000122070312,
"logps/rejected": -610.7999877929688,
"loss": 2.7742,
"rewards/accuracies": 0.484375,
"rewards/chosen": 2.9834961891174316,
"rewards/margins": 7.629687309265137,
"rewards/rejected": -4.647656440734863,
"step": 1910
},
{
"epoch": 0.9014084507042254,
"grad_norm": 348.56386639341446,
"learning_rate": 5.50339071465832e-08,
"logits/chosen": -4.190625190734863,
"logits/rejected": -4.131249904632568,
"logps/chosen": -569.5999755859375,
"logps/rejected": -602.7999877929688,
"loss": 2.9703,
"rewards/accuracies": 0.4859375059604645,
"rewards/chosen": 2.2406249046325684,
"rewards/margins": 6.949999809265137,
"rewards/rejected": -4.706250190734863,
"step": 1920
},
{
"epoch": 0.9061032863849765,
"grad_norm": 289.60524521320974,
"learning_rate": 5.2425665101721436e-08,
"logits/chosen": -4.134375095367432,
"logits/rejected": -4.010937690734863,
"logps/chosen": -581.0,
"logps/rejected": -690.7999877929688,
"loss": 3.0283,
"rewards/accuracies": 0.4976562559604645,
"rewards/chosen": 2.378124952316284,
"rewards/margins": 9.306249618530273,
"rewards/rejected": -6.9296875,
"step": 1930
},
{
"epoch": 0.9107981220657277,
"grad_norm": 270.1629735994182,
"learning_rate": 4.9817423056859675e-08,
"logits/chosen": -4.203125,
"logits/rejected": -4.089062690734863,
"logps/chosen": -575.0,
"logps/rejected": -660.0,
"loss": 2.6411,
"rewards/accuracies": 0.500781238079071,
"rewards/chosen": 2.956249952316284,
"rewards/margins": 9.699999809265137,
"rewards/rejected": -6.737500190734863,
"step": 1940
},
{
"epoch": 0.9154929577464789,
"grad_norm": 265.7065287868444,
"learning_rate": 4.720918101199791e-08,
"logits/chosen": -4.09375,
"logits/rejected": -3.981250047683716,
"logps/chosen": -581.7999877929688,
"logps/rejected": -714.4000244140625,
"loss": 2.945,
"rewards/accuracies": 0.4937500059604645,
"rewards/chosen": 2.404296875,
"rewards/margins": 10.553125381469727,
"rewards/rejected": -8.143750190734863,
"step": 1950
},
{
"epoch": 0.92018779342723,
"grad_norm": 250.18801620417574,
"learning_rate": 4.460093896713615e-08,
"logits/chosen": -4.209374904632568,
"logits/rejected": -4.074999809265137,
"logps/chosen": -561.5999755859375,
"logps/rejected": -666.7999877929688,
"loss": 2.8794,
"rewards/accuracies": 0.49609375,
"rewards/chosen": 2.867968797683716,
"rewards/margins": 8.409375190734863,
"rewards/rejected": -5.537499904632568,
"step": 1960
},
{
"epoch": 0.9248826291079812,
"grad_norm": 230.95525396987273,
"learning_rate": 4.199269692227438e-08,
"logits/chosen": -4.1875,
"logits/rejected": -4.123437404632568,
"logps/chosen": -552.7999877929688,
"logps/rejected": -604.2000122070312,
"loss": 3.1617,
"rewards/accuracies": 0.500781238079071,
"rewards/chosen": 2.604687452316284,
"rewards/margins": 7.143750190734863,
"rewards/rejected": -4.538281440734863,
"step": 1970
},
{
"epoch": 0.9295774647887324,
"grad_norm": 203.14051919454678,
"learning_rate": 3.938445487741262e-08,
"logits/chosen": -4.123437404632568,
"logits/rejected": -3.989062547683716,
"logps/chosen": -579.4000244140625,
"logps/rejected": -638.0,
"loss": 2.8828,
"rewards/accuracies": 0.484375,
"rewards/chosen": 2.0751953125,
"rewards/margins": 9.285937309265137,
"rewards/rejected": -7.2109375,
"step": 1980
},
{
"epoch": 0.9342723004694836,
"grad_norm": 342.2288255482226,
"learning_rate": 3.677621283255086e-08,
"logits/chosen": -4.21875,
"logits/rejected": -4.134375095367432,
"logps/chosen": -584.4000244140625,
"logps/rejected": -638.4000244140625,
"loss": 3.0422,
"rewards/accuracies": 0.4867187440395355,
"rewards/chosen": 2.6312499046325684,
"rewards/margins": 8.221875190734863,
"rewards/rejected": -5.589062690734863,
"step": 1990
},
{
"epoch": 0.9389671361502347,
"grad_norm": 214.8039554016909,
"learning_rate": 3.41679707876891e-08,
"logits/chosen": -4.153124809265137,
"logits/rejected": -4.042187690734863,
"logps/chosen": -568.7999877929688,
"logps/rejected": -698.0,
"loss": 2.5212,
"rewards/accuracies": 0.4921875,
"rewards/chosen": 2.428906202316284,
"rewards/margins": 9.993749618530273,
"rewards/rejected": -7.5546875,
"step": 2000
},
{
"epoch": 0.9436619718309859,
"grad_norm": 438.04502258424424,
"learning_rate": 3.155972874282733e-08,
"logits/chosen": -4.228125095367432,
"logits/rejected": -4.118750095367432,
"logps/chosen": -545.7999877929688,
"logps/rejected": -633.5999755859375,
"loss": 2.52,
"rewards/accuracies": 0.516406238079071,
"rewards/chosen": 2.612499952316284,
"rewards/margins": 8.423437118530273,
"rewards/rejected": -5.814843654632568,
"step": 2010
},
{
"epoch": 0.9483568075117371,
"grad_norm": 232.40256926460418,
"learning_rate": 2.8951486697965573e-08,
"logits/chosen": -4.153124809265137,
"logits/rejected": -4.071875095367432,
"logps/chosen": -579.7999877929688,
"logps/rejected": -654.7999877929688,
"loss": 2.5768,
"rewards/accuracies": 0.4945312440395355,
"rewards/chosen": 2.94921875,
"rewards/margins": 9.087499618530273,
"rewards/rejected": -6.140625,
"step": 2020
},
{
"epoch": 0.9530516431924883,
"grad_norm": 247.32217363390706,
"learning_rate": 2.634324465310381e-08,
"logits/chosen": -4.201562404632568,
"logits/rejected": -4.079687595367432,
"logps/chosen": -554.4000244140625,
"logps/rejected": -640.7999877929688,
"loss": 2.808,
"rewards/accuracies": 0.5078125,
"rewards/chosen": 2.303906202316284,
"rewards/margins": 8.643750190734863,
"rewards/rejected": -6.345312595367432,
"step": 2030
},
{
"epoch": 0.9577464788732394,
"grad_norm": 216.75114769995488,
"learning_rate": 2.3735002608242045e-08,
"logits/chosen": -4.1796875,
"logits/rejected": -4.096875190734863,
"logps/chosen": -573.5999755859375,
"logps/rejected": -616.7999877929688,
"loss": 2.5154,
"rewards/accuracies": 0.4937500059604645,
"rewards/chosen": 2.692578077316284,
"rewards/margins": 8.834375381469727,
"rewards/rejected": -6.143750190734863,
"step": 2040
},
{
"epoch": 0.9624413145539906,
"grad_norm": 244.4652512645769,
"learning_rate": 2.1126760563380282e-08,
"logits/chosen": -4.184374809265137,
"logits/rejected": -4.109375,
"logps/chosen": -559.5999755859375,
"logps/rejected": -592.7999877929688,
"loss": 2.6575,
"rewards/accuracies": 0.4828124940395355,
"rewards/chosen": 2.5406250953674316,
"rewards/margins": 7.303124904632568,
"rewards/rejected": -4.754687309265137,
"step": 2050
},
{
"epoch": 0.9671361502347418,
"grad_norm": 1006.669099795599,
"learning_rate": 1.8518518518518518e-08,
"logits/chosen": -4.175000190734863,
"logits/rejected": -4.060937404632568,
"logps/chosen": -584.7999877929688,
"logps/rejected": -644.7999877929688,
"loss": 2.9606,
"rewards/accuracies": 0.507031261920929,
"rewards/chosen": 2.246875047683716,
"rewards/margins": 7.487500190734863,
"rewards/rejected": -5.237500190734863,
"step": 2060
},
{
"epoch": 0.971830985915493,
"grad_norm": 245.9856583194556,
"learning_rate": 1.5910276473656755e-08,
"logits/chosen": -4.143750190734863,
"logits/rejected": -4.0078125,
"logps/chosen": -559.7999877929688,
"logps/rejected": -639.7999877929688,
"loss": 2.6479,
"rewards/accuracies": 0.507031261920929,
"rewards/chosen": 2.8199219703674316,
"rewards/margins": 9.907812118530273,
"rewards/rejected": -7.089062690734863,
"step": 2070
},
{
"epoch": 0.9765258215962441,
"grad_norm": 219.87542070354826,
"learning_rate": 1.3302034428794991e-08,
"logits/chosen": -4.224999904632568,
"logits/rejected": -4.196875095367432,
"logps/chosen": -540.0,
"logps/rejected": -604.5999755859375,
"loss": 2.5598,
"rewards/accuracies": 0.5289062261581421,
"rewards/chosen": 2.6328125,
"rewards/margins": 9.142187118530273,
"rewards/rejected": -6.515625,
"step": 2080
},
{
"epoch": 0.9812206572769953,
"grad_norm": 319.2812742395816,
"learning_rate": 1.0693792383933229e-08,
"logits/chosen": -4.232812404632568,
"logits/rejected": -4.173437595367432,
"logps/chosen": -572.4000244140625,
"logps/rejected": -652.4000244140625,
"loss": 2.8662,
"rewards/accuracies": 0.4867187440395355,
"rewards/chosen": 2.889843702316284,
"rewards/margins": 9.271875381469727,
"rewards/rejected": -6.3828125,
"step": 2090
},
{
"epoch": 0.9859154929577465,
"grad_norm": 289.0276689267499,
"learning_rate": 8.085550339071465e-09,
"logits/chosen": -4.175000190734863,
"logits/rejected": -4.076562404632568,
"logps/chosen": -587.5999755859375,
"logps/rejected": -685.0,
"loss": 3.2285,
"rewards/accuracies": 0.49296873807907104,
"rewards/chosen": 2.369921922683716,
"rewards/margins": 8.143750190734863,
"rewards/rejected": -5.768750190734863,
"step": 2100
},
{
"epoch": 0.9906103286384976,
"grad_norm": 318.56380856780027,
"learning_rate": 5.4773082942097025e-09,
"logits/chosen": -4.196875095367432,
"logits/rejected": -4.131249904632568,
"logps/chosen": -556.4000244140625,
"logps/rejected": -619.5999755859375,
"loss": 2.3993,
"rewards/accuracies": 0.5234375,
"rewards/chosen": 2.5599608421325684,
"rewards/margins": 8.771875381469727,
"rewards/rejected": -6.2109375,
"step": 2110
},
{
"epoch": 0.9953051643192489,
"grad_norm": 236.34850676325576,
"learning_rate": 2.8690662493479393e-09,
"logits/chosen": -4.240624904632568,
"logits/rejected": -4.079687595367432,
"logps/chosen": -557.5999755859375,
"logps/rejected": -629.5999755859375,
"loss": 3.6049,
"rewards/accuracies": 0.5023437738418579,
"rewards/chosen": 2.610546827316284,
"rewards/margins": 7.922461032867432,
"rewards/rejected": -5.306640625,
"step": 2120
},
{
"epoch": 1.0,
"grad_norm": 221.64813357708303,
"learning_rate": 2.608242044861763e-10,
"logits/chosen": -4.199999809265137,
"logits/rejected": -4.160937309265137,
"logps/chosen": -556.2000122070312,
"logps/rejected": -654.4000244140625,
"loss": 2.6604,
"rewards/accuracies": 0.5190496444702148,
"rewards/chosen": 3.0367188453674316,
"rewards/margins": 10.324999809265137,
"rewards/rejected": -7.287499904632568,
"step": 2130
},
{
"epoch": 1.0,
"step": 2130,
"total_flos": 0.0,
"train_loss": 2.805410225738382,
"train_runtime": 6798.7376,
"train_samples_per_second": 40.093,
"train_steps_per_second": 0.313
}
],
"logging_steps": 10,
"max_steps": 2130,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}