479 lines
15 KiB
JSON
479 lines
15 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 1.0,
|
|
"eval_steps": 500,
|
|
"global_step": 292,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"epoch": 0.034327397554172925,
|
|
"grad_norm": 0.13235517649406559,
|
|
"learning_rate": 1.5e-07,
|
|
"logits/chosen": -1.796875,
|
|
"logits/rejected": -1.7734375,
|
|
"logps/chosen": -0.279296875,
|
|
"logps/rejected": -0.287109375,
|
|
"loss": 0.6910988092422485,
|
|
"rewards/accuracies": 0.871874988079071,
|
|
"rewards/chosen": 2.3506689071655273,
|
|
"rewards/margins": 0.8857603073120117,
|
|
"rewards/rejected": 1.4649085998535156,
|
|
"step": 10
|
|
},
|
|
{
|
|
"epoch": 0.06865479510834585,
|
|
"grad_norm": 0.46053938490310314,
|
|
"learning_rate": 3.166666666666666e-07,
|
|
"logits/chosen": -1.71875,
|
|
"logits/rejected": -1.6484375,
|
|
"logps/chosen": -0.287109375,
|
|
"logps/rejected": -0.30078125,
|
|
"loss": 0.6888490915298462,
|
|
"rewards/accuracies": 0.8687499761581421,
|
|
"rewards/chosen": 3.4280261993408203,
|
|
"rewards/margins": 1.77581787109375,
|
|
"rewards/rejected": 1.6522083282470703,
|
|
"step": 20
|
|
},
|
|
{
|
|
"epoch": 0.10298219266251878,
|
|
"grad_norm": 0.5748589989414592,
|
|
"learning_rate": 4.833333333333333e-07,
|
|
"logits/chosen": -1.8359375,
|
|
"logits/rejected": -1.7734375,
|
|
"logps/chosen": -0.275390625,
|
|
"logps/rejected": -0.291015625,
|
|
"loss": 0.6906450986862183,
|
|
"rewards/accuracies": 0.846875011920929,
|
|
"rewards/chosen": 2.2481327056884766,
|
|
"rewards/margins": 1.028005599975586,
|
|
"rewards/rejected": 1.2201271057128906,
|
|
"step": 30
|
|
},
|
|
{
|
|
"epoch": 0.1373095902166917,
|
|
"grad_norm": 0.2006004776289312,
|
|
"learning_rate": 4.985456442051682e-07,
|
|
"logits/chosen": -1.8515625,
|
|
"logits/rejected": -1.8203125,
|
|
"logps/chosen": -0.287109375,
|
|
"logps/rejected": -0.3046875,
|
|
"loss": 0.6906946897506714,
|
|
"rewards/accuracies": 0.8812500238418579,
|
|
"rewards/chosen": 2.435636520385742,
|
|
"rewards/margins": 1.0178546905517578,
|
|
"rewards/rejected": 1.4177818298339844,
|
|
"step": 40
|
|
},
|
|
{
|
|
"epoch": 0.1716369877708646,
|
|
"grad_norm": 0.18428774018840577,
|
|
"learning_rate": 4.935399618791793e-07,
|
|
"logits/chosen": -1.828125,
|
|
"logits/rejected": -1.7890625,
|
|
"logps/chosen": -0.28125,
|
|
"logps/rejected": -0.30078125,
|
|
"loss": 0.6899381875991821,
|
|
"rewards/accuracies": 0.862500011920929,
|
|
"rewards/chosen": 2.6294727325439453,
|
|
"rewards/margins": 1.3235273361206055,
|
|
"rewards/rejected": 1.3059453964233398,
|
|
"step": 50
|
|
},
|
|
{
|
|
"epoch": 0.20596438532503755,
|
|
"grad_norm": 0.18512484897108686,
|
|
"learning_rate": 4.850368660819092e-07,
|
|
"logits/chosen": -1.921875,
|
|
"logits/rejected": -1.8125,
|
|
"logps/chosen": -0.287109375,
|
|
"logps/rejected": -0.314453125,
|
|
"loss": 0.6910680532455444,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/chosen": 1.676849365234375,
|
|
"rewards/margins": 0.8419876098632812,
|
|
"rewards/rejected": 0.8348617553710938,
|
|
"step": 60
|
|
},
|
|
{
|
|
"epoch": 0.24029178287921046,
|
|
"grad_norm": 1.1253206572256385,
|
|
"learning_rate": 4.731584675403184e-07,
|
|
"logits/chosen": -1.734375,
|
|
"logits/rejected": -1.65625,
|
|
"logps/chosen": -0.36328125,
|
|
"logps/rejected": -0.419921875,
|
|
"loss": 0.6878849267959595,
|
|
"rewards/accuracies": 0.8999999761581421,
|
|
"rewards/chosen": 2.3861775398254395,
|
|
"rewards/margins": 2.1874728202819824,
|
|
"rewards/rejected": 0.19870471954345703,
|
|
"step": 70
|
|
},
|
|
{
|
|
"epoch": 0.2746191804333834,
|
|
"grad_norm": 0.26830425166650457,
|
|
"learning_rate": 4.5807534881817183e-07,
|
|
"logits/chosen": -1.9140625,
|
|
"logits/rejected": -1.84375,
|
|
"logps/chosen": -0.419921875,
|
|
"logps/rejected": -0.396484375,
|
|
"loss": 0.6916324496269226,
|
|
"rewards/accuracies": 0.878125011920929,
|
|
"rewards/chosen": 0.9153213500976562,
|
|
"rewards/margins": 0.7323864102363586,
|
|
"rewards/rejected": 0.18293499946594238,
|
|
"step": 80
|
|
},
|
|
{
|
|
"epoch": 0.3089465779875563,
|
|
"grad_norm": 0.44824632017143134,
|
|
"learning_rate": 4.400041146246136e-07,
|
|
"logits/chosen": -1.8984375,
|
|
"logits/rejected": -1.828125,
|
|
"logps/chosen": -0.50390625,
|
|
"logps/rejected": -0.58203125,
|
|
"loss": 0.6880173683166504,
|
|
"rewards/accuracies": 0.862500011920929,
|
|
"rewards/chosen": 0.8662147521972656,
|
|
"rewards/margins": 2.2269763946533203,
|
|
"rewards/rejected": -1.3607616424560547,
|
|
"step": 90
|
|
},
|
|
{
|
|
"epoch": 0.3432739755417292,
|
|
"grad_norm": 0.1410533748955083,
|
|
"learning_rate": 4.1920428121079e-07,
|
|
"logits/chosen": -2.0,
|
|
"logits/rejected": -1.9609375,
|
|
"logps/chosen": -0.33984375,
|
|
"logps/rejected": -0.64453125,
|
|
"loss": 0.685782790184021,
|
|
"rewards/accuracies": 0.871874988079071,
|
|
"rewards/chosen": 1.1494998931884766,
|
|
"rewards/margins": 3.4339561462402344,
|
|
"rewards/rejected": -2.284456253051758,
|
|
"step": 100
|
|
},
|
|
{
|
|
"epoch": 0.3776013730959022,
|
|
"grad_norm": 0.5379072097770938,
|
|
"learning_rate": 3.959745495250818e-07,
|
|
"logits/chosen": -2.15625,
|
|
"logits/rejected": -2.09375,
|
|
"logps/chosen": -0.54296875,
|
|
"logps/rejected": -0.81640625,
|
|
"loss": 0.6863765716552734,
|
|
"rewards/accuracies": 0.903124988079071,
|
|
"rewards/chosen": -0.4936180114746094,
|
|
"rewards/margins": 3.31402587890625,
|
|
"rewards/rejected": -3.8076438903808594,
|
|
"step": 110
|
|
},
|
|
{
|
|
"epoch": 0.4119287706500751,
|
|
"grad_norm": 0.632156995264805,
|
|
"learning_rate": 3.7064851564718353e-07,
|
|
"logits/chosen": -2.125,
|
|
"logits/rejected": -2.046875,
|
|
"logps/chosen": -0.78515625,
|
|
"logps/rejected": -1.2578125,
|
|
"loss": 0.68132483959198,
|
|
"rewards/accuracies": 0.8656250238418579,
|
|
"rewards/chosen": -2.0970020294189453,
|
|
"rewards/margins": 5.965912818908691,
|
|
"rewards/rejected": -8.062914848327637,
|
|
"step": 120
|
|
},
|
|
{
|
|
"epoch": 0.446256168204248,
|
|
"grad_norm": 0.29509039010906096,
|
|
"learning_rate": 3.4358988010236103e-07,
|
|
"logits/chosen": -2.171875,
|
|
"logits/rejected": -2.125,
|
|
"logps/chosen": -0.77734375,
|
|
"logps/rejected": -0.76953125,
|
|
"loss": 0.6925566792488098,
|
|
"rewards/accuracies": 0.8531249761581421,
|
|
"rewards/chosen": -2.3850326538085938,
|
|
"rewards/margins": 1.1250333786010742,
|
|
"rewards/rejected": -3.510066270828247,
|
|
"step": 130
|
|
},
|
|
{
|
|
"epoch": 0.4805835657584209,
|
|
"grad_norm": 0.47331294084946895,
|
|
"learning_rate": 3.1518722485366754e-07,
|
|
"logits/chosen": -2.15625,
|
|
"logits/rejected": -2.09375,
|
|
"logps/chosen": -0.70703125,
|
|
"logps/rejected": -1.0078125,
|
|
"loss": 0.6853899359703064,
|
|
"rewards/accuracies": 0.840624988079071,
|
|
"rewards/chosen": -1.8102607727050781,
|
|
"rewards/margins": 3.870941162109375,
|
|
"rewards/rejected": -5.681201934814453,
|
|
"step": 140
|
|
},
|
|
{
|
|
"epoch": 0.5149109633125939,
|
|
"grad_norm": 0.1721985746029916,
|
|
"learning_rate": 2.8584843297836277e-07,
|
|
"logits/chosen": -2.1875,
|
|
"logits/rejected": -2.140625,
|
|
"logps/chosen": -0.96875,
|
|
"logps/rejected": -1.53125,
|
|
"loss": 0.6819590926170349,
|
|
"rewards/accuracies": 0.8531249761581421,
|
|
"rewards/chosen": -4.2430419921875,
|
|
"rewards/margins": 6.290306091308594,
|
|
"rewards/rejected": -10.533348083496094,
|
|
"step": 150
|
|
},
|
|
{
|
|
"epoch": 0.5492383608667668,
|
|
"grad_norm": 0.3995964568343347,
|
|
"learning_rate": 2.5599483116609544e-07,
|
|
"logits/chosen": -2.234375,
|
|
"logits/rejected": -2.1875,
|
|
"logps/chosen": -0.75390625,
|
|
"logps/rejected": -1.390625,
|
|
"loss": 0.6798478364944458,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -2.2219924926757812,
|
|
"rewards/margins": 7.207763671875,
|
|
"rewards/rejected": -9.429756164550781,
|
|
"step": 160
|
|
},
|
|
{
|
|
"epoch": 0.5835657584209397,
|
|
"grad_norm": 0.6243919555680963,
|
|
"learning_rate": 2.2605513915689874e-07,
|
|
"logits/chosen": -2.296875,
|
|
"logits/rejected": -2.265625,
|
|
"logps/chosen": -0.83984375,
|
|
"logps/rejected": -1.34375,
|
|
"loss": 0.6825442314147949,
|
|
"rewards/accuracies": 0.840624988079071,
|
|
"rewards/chosen": -2.7797412872314453,
|
|
"rewards/margins": 5.878034591674805,
|
|
"rewards/rejected": -8.65777587890625,
|
|
"step": 170
|
|
},
|
|
{
|
|
"epoch": 0.6178931559751126,
|
|
"grad_norm": 1.1278942630482116,
|
|
"learning_rate": 1.9645931300952795e-07,
|
|
"logits/chosen": -2.28125,
|
|
"logits/rejected": -2.234375,
|
|
"logps/chosen": -0.88671875,
|
|
"logps/rejected": -1.2578125,
|
|
"loss": 0.6869114637374878,
|
|
"rewards/accuracies": 0.8500000238418579,
|
|
"rewards/chosen": -3.503103256225586,
|
|
"rewards/margins": 4.543584823608398,
|
|
"rewards/rejected": -8.046688079833984,
|
|
"step": 180
|
|
},
|
|
{
|
|
"epoch": 0.6522205535292855,
|
|
"grad_norm": 0.557496853431999,
|
|
"learning_rate": 1.6763237061535008e-07,
|
|
"logits/chosen": -2.265625,
|
|
"logits/rejected": -2.234375,
|
|
"logps/chosen": -0.6484375,
|
|
"logps/rejected": -1.1015625,
|
|
"loss": 0.6827899217605591,
|
|
"rewards/accuracies": 0.815625011920929,
|
|
"rewards/chosen": -1.5933113098144531,
|
|
"rewards/margins": 5.051255226135254,
|
|
"rewards/rejected": -6.644566535949707,
|
|
"step": 190
|
|
},
|
|
{
|
|
"epoch": 0.6865479510834585,
|
|
"grad_norm": 0.17143843440576617,
|
|
"learning_rate": 1.3998828812795932e-07,
|
|
"logits/chosen": -2.375,
|
|
"logits/rejected": -2.296875,
|
|
"logps/chosen": -0.7109375,
|
|
"logps/rejected": -0.96484375,
|
|
"loss": 0.6855746507644653,
|
|
"rewards/accuracies": 0.893750011920929,
|
|
"rewards/chosen": -1.8840103149414062,
|
|
"rewards/margins": 3.5195465087890625,
|
|
"rewards/rejected": -5.403556823730469,
|
|
"step": 200
|
|
},
|
|
{
|
|
"epoch": 0.7208753486376314,
|
|
"grad_norm": 0.3704174071598696,
|
|
"learning_rate": 1.1392405496029076e-07,
|
|
"logits/chosen": -2.421875,
|
|
"logits/rejected": -2.375,
|
|
"logps/chosen": -0.90234375,
|
|
"logps/rejected": -1.3671875,
|
|
"loss": 0.6831818222999573,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -3.901020050048828,
|
|
"rewards/margins": 5.629344940185547,
|
|
"rewards/rejected": -9.530364990234375,
|
|
"step": 210
|
|
},
|
|
{
|
|
"epoch": 0.7552027461918044,
|
|
"grad_norm": 0.29755655034839396,
|
|
"learning_rate": 8.981397272385738e-08,
|
|
"logits/chosen": -2.390625,
|
|
"logits/rejected": -2.265625,
|
|
"logps/chosen": -0.5625,
|
|
"logps/rejected": -0.86328125,
|
|
"loss": 0.6854575276374817,
|
|
"rewards/accuracies": 0.856249988079071,
|
|
"rewards/chosen": -0.9891986846923828,
|
|
"rewards/margins": 3.597726821899414,
|
|
"rewards/rejected": -4.586925506591797,
|
|
"step": 220
|
|
},
|
|
{
|
|
"epoch": 0.7895301437459773,
|
|
"grad_norm": 0.5727075004030926,
|
|
"learning_rate": 6.800427998154968e-08,
|
|
"logits/chosen": -2.421875,
|
|
"logits/rejected": -2.296875,
|
|
"logps/chosen": -1.15625,
|
|
"logps/rejected": -2.296875,
|
|
"loss": 0.6726676225662231,
|
|
"rewards/accuracies": 0.840624988079071,
|
|
"rewards/chosen": -5.837119102478027,
|
|
"rewards/margins": 11.716462135314941,
|
|
"rewards/rejected": -17.55358123779297,
|
|
"step": 230
|
|
},
|
|
{
|
|
"epoch": 0.8238575413001502,
|
|
"grad_norm": 0.20114138622145075,
|
|
"learning_rate": 4.8808180006509356e-08,
|
|
"logits/chosen": -2.328125,
|
|
"logits/rejected": -2.265625,
|
|
"logps/chosen": -0.94140625,
|
|
"logps/rejected": -1.3515625,
|
|
"loss": 0.6838194727897644,
|
|
"rewards/accuracies": 0.8031250238418579,
|
|
"rewards/chosen": -3.888202667236328,
|
|
"rewards/margins": 5.167751312255859,
|
|
"rewards/rejected": -9.055953979492188,
|
|
"step": 240
|
|
},
|
|
{
|
|
"epoch": 0.8581849388543231,
|
|
"grad_norm": 0.4933550514010035,
|
|
"learning_rate": 3.250134295213053e-08,
|
|
"logits/chosen": -2.375,
|
|
"logits/rejected": -2.328125,
|
|
"logps/chosen": -0.76171875,
|
|
"logps/rejected": -0.95703125,
|
|
"loss": 0.6869604587554932,
|
|
"rewards/accuracies": 0.846875011920929,
|
|
"rewards/chosen": -2.8221282958984375,
|
|
"rewards/margins": 2.9920434951782227,
|
|
"rewards/rejected": -5.81417179107666,
|
|
"step": 250
|
|
},
|
|
{
|
|
"epoch": 0.892512336408496,
|
|
"grad_norm": 0.6922209770737316,
|
|
"learning_rate": 1.9317947025340232e-08,
|
|
"logits/chosen": -2.296875,
|
|
"logits/rejected": -2.21875,
|
|
"logps/chosen": -1.4765625,
|
|
"logps/rejected": -1.5234375,
|
|
"loss": 0.6916182637214661,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/chosen": -8.145744323730469,
|
|
"rewards/margins": 2.6402759552001953,
|
|
"rewards/rejected": -10.786020278930664,
|
|
"step": 260
|
|
},
|
|
{
|
|
"epoch": 0.9268397339626689,
|
|
"grad_norm": 0.4424320735292111,
|
|
"learning_rate": 9.447315514833353e-09,
|
|
"logits/chosen": -2.375,
|
|
"logits/rejected": -2.3125,
|
|
"logps/chosen": -0.84375,
|
|
"logps/rejected": -1.03125,
|
|
"loss": 0.6869756579399109,
|
|
"rewards/accuracies": 0.84375,
|
|
"rewards/chosen": -3.4899368286132812,
|
|
"rewards/margins": 2.9231185913085938,
|
|
"rewards/rejected": -6.413055419921875,
|
|
"step": 270
|
|
},
|
|
{
|
|
"epoch": 0.9611671315168419,
|
|
"grad_norm": 0.3058992016047687,
|
|
"learning_rate": 3.0311979690147426e-09,
|
|
"logits/chosen": -2.359375,
|
|
"logits/rejected": -2.25,
|
|
"logps/chosen": -0.9921875,
|
|
"logps/rejected": -1.3515625,
|
|
"loss": 0.6848438382148743,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -4.557971954345703,
|
|
"rewards/margins": 4.624332427978516,
|
|
"rewards/rejected": -9.182304382324219,
|
|
"step": 280
|
|
},
|
|
{
|
|
"epoch": 0.9954945290710148,
|
|
"grad_norm": 0.19881067947724387,
|
|
"learning_rate": 1.6173456793908135e-10,
|
|
"logits/chosen": -2.375,
|
|
"logits/rejected": -2.34375,
|
|
"logps/chosen": -0.94921875,
|
|
"logps/rejected": -1.3125,
|
|
"loss": 0.6863315105438232,
|
|
"rewards/accuracies": 0.859375,
|
|
"rewards/chosen": -4.277503967285156,
|
|
"rewards/margins": 4.613258361816406,
|
|
"rewards/rejected": -8.890762329101562,
|
|
"step": 290
|
|
},
|
|
{
|
|
"epoch": 1.0,
|
|
"step": 292,
|
|
"total_flos": 0.0,
|
|
"train_loss": 0.6846090351065545,
|
|
"train_runtime": 26441.528,
|
|
"train_samples_per_second": 0.705,
|
|
"train_steps_per_second": 0.011
|
|
}
|
|
],
|
|
"logging_steps": 10,
|
|
"max_steps": 292,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 1,
|
|
"save_steps": 1000,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": true
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 0.0,
|
|
"train_batch_size": 2,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|